Soumettre un événement
Groupe de lecture BRISA 03 - TOPReward

Groupe de lecture BRISA 03 - TOPReward

08 sept. 202618:30 - 20:00 Europe/BerlinBerlin, Germany10 ParticipantsOpen

Description

Avant notre lancement officiel cet automne, nous continuons notre série pré-lancement avec un autre groupe de lecture : s'asseoir avec un document, le comprendre correctement et se demander ce qu'il faudrait pour le construire nous-mêmes. Notre troisième document est TOPReward : Probabilités de jeton comme signaux de récompense cachés en zero-shot pour la robotique (Chen et al., 2026), qui pose une question étonnamment simple : Un modèle de Vision-Langage pré-entraîné peut-il déjà nous dire à quel point un robot réussit — sans entraîner un modèle de récompense séparé ? Dans l'apprentissage robotique, savoir si une tâche a été complétée est relativement facile. Savoir combien de progrès le robot fait en cours de route est beaucoup plus difficile. TOPReward aborde cela sans concevoir manuellement des récompenses ou entraîner un autre modèle. Au lieu de demander à un VLM de produire explicitement un score de progression, il demande au modèle si une tâche a été complétée et examine directement les probabilités qu'il attribue aux jetons de réponse possibles. Ces probabilités de jeton deviennent un signal de récompense en zero-shot qui peut être utilisé pour mesurer la progression des tâches, détecter le succès et réajuster les démonstrations du robot. Ce qui rend l'idée particulièrement intéressante, c'est que le modèle de récompense lui-même n'a jamais été explicitement entraîné pour être un modèle de récompense. Le document soulève donc une question plus large : Quelle supervision utile est déjà cachée dans les modèles de base si nous savons où chercher ? TOPReward est également entré dans notre exploration à travers MolmoAct2, où il est utilisé comme signal de récompense à l'intérieur d'un pipeline d'apprentissage robotique plus large. Au cours de la session, nous nous concentrerons sur trois choses : comment fonctionne réellement TOPReward, comment il est appliqué à une politique visuomotrice relativement simple comme ManiFlow — qui n'est pas un VLA — et ce qui arrive aux performances de la politique lorsque les démonstrations sont réajustées en utilisant ce signal. Cela nous donne une question intéressante au-delà de TOPReward lui-même : La connaissance cachée à l'intérieur d'un VLM peut-elle améliorer des politiques robotisées qui n'utilisent pas un VLM du tout lors de l'inférence ? Et, comme toujours, nous examinerons au-delà des résultats principaux : à quel point le signal de récompense est-il convaincant, que capture-t-il réellement, où pourrait-il échouer, et à quel point serait-il difficile de reproduire l'idée nous-mêmes ? Aucune préparation nécessaire. Parcourez le résumé si vous avez dix minutes. Tout le monde est bienvenu — peu importe ce que vous étudiez, où vous étudiez et combien de robotique vous avez faite jusqu'à présent. Venez avec des questions, des désaccords ou votre propre point de vue sur la façon dont les modèles de base devraient être utilisés dans l'apprentissage robotique. 🎟️ Il n'y a qu'un nombre limité de places, afin que nous puissions garder la session personnelle et interactive. Veuillez vous inscrire tôt et n'assister qu'après avoir reçu un ticket. 📍 Organisé au Merantix AI Campus. Les portes ouvrent à 18h30, nous commençons à 18h45. 👋 Nouveau ici ? Rejoignez le groupe communautaire — tout le reste est annoncé là en premier.

Lieu de l`événement

Faites savoir à votre réseau que vous y allez

Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.

Related events

Plateforme d’intelligence artificielle

Gratuit
S`inscrire gratuitement