Додати подію
BRISA Reading Group 03 - TOPReward

BRISA Reading Group 03 - TOPReward

08 вер 202618:30 - 20:00 Europe/BerlinBerlin, Germany10 УчасниківOpen

Опис

Перед нашим официальным запуском этой осенью, мы продолжаем нашу предзапусковую серию с еще одной чтением группы: садимся с документом, правильно его понимаем и задаем вопрос, что потребовалось бы, чтобы построить это сами. Наш третий документ - TOPReward: Вероятности токенов как скрытые нулевые вознаграждения для робототехники (Chen и др., 2026), который задает удивительно простой вопрос: Может ли предобученная модель зрения-языка уже сказать нам, как хорошо работает робот – без обучения отдельной модели вознаграждения? В обучении роботов знать, была ли задача выполнена, относительно легко. Знать, сколько прогресса робот делает по пути, значительно сложнее. TOPReward подходит к этому без ручного проектирования вознаграждений или обучения другой модели. Вместо того, чтобы спрашивать VLM, чтобы явно вывести оценку прогресса, он спрашивает модель, была ли задача выполнена, и смотрит напрямую на вероятности, которые она присваивает возможным ответным токенам. Эти вероятности токенов становятся сигналом вознаграждения нулевого выстрела, который может быть использован для измерения прогресса задачи, обнаружения успеха и переоценки демонстраций робота. Что делает идею особенно интересной, так это то, что сама модель вознаграждения никогда не была явно обучена как модель вознаграждения. Поэтому статья поднимает более широкий вопрос: Сколько полезного надзора уже скрыто внутри основных моделей, если мы знаем, где его искать? TOPReward также вошел в наше исследование через MolmoAct2, где он используется как сигнал вознаграждения внутри более крупного конвейера обучения роботов. Во время сессии мы сосредоточимся на трех вещах: как на самом деле работает TOPReward, как он применяется к относительно простой визуомоторной политике, такой как ManiFlow — которая не является VLA — и что происходит с производительностью политики, когда демонстрации переоцениваются с использованием этого сигнала. Это дает нам интересный вопрос, помимо самого TOPReward: Может ли знание, скрытое внутри VLM, улучшить роботизированные политики, которые вовсе не используют VLM во время вывода? И, как всегда, мы будем смотреть за пределы заголовочных результатов: насколько убедителен сигнал вознаграждения, что он на самом деле захватывает, где он может провалиться и как трудно было бы воспроизвести идею самим? Подготовка не требуется. Просмотрите аннотацию, если у вас есть десять минут. Все приветствуются — независимо от того, что вы учите, где вы учите и сколько робототехники вы сделали до сих пор. Приходите с вопросами, разногласиями или своим мнением о том, как основные модели должны использоваться в обучении роботов. 🎟️ Количество мест ограничено, поэтому мы можем сделать сессию личной и интерактивной. Пожалуйста, регистрируйтесь рано и посещайте только если получили билет. 📍 Место проведения — AI Campus Merantix. Двери открываются в 18:30, начинаем в 18:45. 👋 Новичок здесь? Присоединяйтесь к группе сообщества — всё остальное объявляется там первым.

Місце проведення

Розкажіть своїй мережі, що ви йдете

Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.

Related events

Платформа штучного інтелекту

Безкоштовно
Зареєструватись безкоштовно