
Группа чтения BRISA 03 - TOPReward
Описание
Перед нашим официальным запуском этой осенью мы продолжаем нашу предзапусковую серию с еще одной группой чтения: садимся с научной статьей, хорошо ее понимаем и задаемся вопросом, что нам нужно, чтобы воспроизвести это самостоятельно. Наша третья статья - TOPReward: Токеновые вероятности как скрытые нулевые вознаграждения для робототехники (Chen и др., 2026), которая задает удивительно простой вопрос: Может ли предварительно обученная Модель Визуального-Языкового Моделя уже сказать нам, как хорошо справляется робот — без обучения отдельной модели вознаграждения? В обучении роботов знать, завершена ли задача, относительно легко. Однако знать, насколько хорошо прогрессирует робот в процессе, значительно сложнее. TOPReward подходит к этому без ручного проектирования вознаграждений или обучения другой модели. Вместо того, чтобы просить VLM явно вывести оценку прогресса, он спрашивает модель, завершена ли задача, и смотрит напрямую на вероятности, которые она присваивает возможным токенам ответов. Эти вероятности токенов становятся сигналом нулевого вознаграждения, который можно использовать для измерения прогресса задачи, обнаружения успеха и переоценки демонстраций робота. Что делает эту идею особенно интересной, так это то, что сама модель вознаграждения никогда не была явно обучена быть моделью вознаграждения. Поэтому статья поднимает более широкий вопрос: Сколько полезного надзора уже скрыто внутри фундаментальных моделей, если мы знаем, где его искать? TOPReward также вошел в наше исследование через MolmoAct2, где он используется как сигнал вознаграждения внутри более широкой цепочки обучения роботов. Во время сессии мы сосредоточимся на трех вещах: как работает TOPReward, как он применяется к относительно простой визуомоторной политике, такой как ManiFlow — которая не является VLA — и что происходит с производительностью политики, когда демонстрации переоцениваются с использованием этого сигнала. Это ставит перед нами интересный вопрос за пределами самого TOPReward: Может ли знание, скрытое внутри VLM, улучшить политики роботов, которые вообще не используют VLM во время вывода? И, как всегда, мы посмотрим за пределы заглавных результатов: насколько убедителен сигнал вознаграждения, что он на самом деле захватывает, где он может потерпеть неудачу и насколько трудно будет воспроизвести эту идею самостоятельно? Подготовка не требуется. Пробежитесь по аннотации, если у вас есть десять минут. Все желающие приглашаются — независимо от того, что вы изучаете, где вы учитесь и сколько робототехники вы уже сделали. Приходите с вопросами, разногласиями или своей точкой зрения на то, как должны использоваться фундаментальные модели в обучении роботов. 🎟️ Мест осталось всего ограниченное количество, чтобы мы могли сделать сессию личной и интерактивной. Пожалуйста, зарегистрируйтесь заранее и приходите только если вы получили билет. 📍 Мероприятие проходит в кампусе Merantix AI. Открытие дверей в 18:30, мы начинаем в 18:45. 👋 Вы новенькие здесь? Присоединяйтесь к группе сообщества — все остальное объявляется там в первую очередь.
Место проведения
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.