
BRISA Reading Group 03 - TOPReward
Опис
Перед нашим официальным запуском этой осенью, мы продолжаем нашу предзапусковую серию с еще одной чтением группы: садимся с документом, правильно его понимаем и задаем вопрос, что потребовалось бы, чтобы построить это сами. Наш третий документ - TOPReward: Вероятности токенов как скрытые нулевые вознаграждения для робототехники (Chen и др., 2026), который задает удивительно простой вопрос: Может ли предобученная модель зрения-языка уже сказать нам, как хорошо работает робот – без обучения отдельной модели вознаграждения? В обучении роботов знать, была ли задача выполнена, относительно легко. Знать, сколько прогресса робот делает по пути, значительно сложнее. TOPReward подходит к этому без ручного проектирования вознаграждений или обучения другой модели. Вместо того, чтобы спрашивать VLM, чтобы явно вывести оценку прогресса, он спрашивает модель, была ли задача выполнена, и смотрит напрямую на вероятности, которые она присваивает возможным ответным токенам. Эти вероятности токенов становятся сигналом вознаграждения нулевого выстрела, который может быть использован для измерения прогресса задачи, обнаружения успеха и переоценки демонстраций робота. Что делает идею особенно интересной, так это то, что сама модель вознаграждения никогда не была явно обучена как модель вознаграждения. Поэтому статья поднимает более широкий вопрос: Сколько полезного надзора уже скрыто внутри основных моделей, если мы знаем, где его искать? TOPReward также вошел в наше исследование через MolmoAct2, где он используется как сигнал вознаграждения внутри более крупного конвейера обучения роботов. Во время сессии мы сосредоточимся на трех вещах: как на самом деле работает TOPReward, как он применяется к относительно простой визуомоторной политике, такой как ManiFlow — которая не является VLA — и что происходит с производительностью политики, когда демонстрации переоцениваются с использованием этого сигнала. Это дает нам интересный вопрос, помимо самого TOPReward: Может ли знание, скрытое внутри VLM, улучшить роботизированные политики, которые вовсе не используют VLM во время вывода? И, как всегда, мы будем смотреть за пределы заголовочных результатов: насколько убедителен сигнал вознаграждения, что он на самом деле захватывает, где он может провалиться и как трудно было бы воспроизвести идею самим? Подготовка не требуется. Просмотрите аннотацию, если у вас есть десять минут. Все приветствуются — независимо от того, что вы учите, где вы учите и сколько робототехники вы сделали до сих пор. Приходите с вопросами, разногласиями или своим мнением о том, как основные модели должны использоваться в обучении роботов. 🎟️ Количество мест ограничено, поэтому мы можем сделать сессию личной и интерактивной. Пожалуйста, регистрируйтесь рано и посещайте только если получили билет. 📍 Место проведения — AI Campus Merantix. Двери открываются в 18:30, начинаем в 18:45. 👋 Новичок здесь? Присоединяйтесь к группе сообщества — всё остальное объявляется там первым.
Місце проведення
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.