
Grupo de Lectura BRISA 03 - TOPReward
Descripción
Antes de nuestro lanzamiento oficial este otoño, continuamos con nuestra serie de pre-lanzamiento con otro grupo de lectura: sentarnos con un artículo, comprenderlo adecuadamente y preguntar qué se necesitaría para construirlo nosotros mismos. Nuestro tercer artículo es TOPReward: Probabilidades de Token como Señales de Recompensa Ocultas Zero-Shot para Robótica (Chen et al., 2026), que plantea una pregunta sorprendentemente simple: ¿Puede un Modelo de Lenguaje-Visión preentrenado ya decirnos qué tan bien lo está haciendo un robot, sin entrenar un modelo de recompensa separado? En el aprendizaje de robots, saber si se ha completado una tarea es relativamente fácil. Saber cuánto progreso está haciendo el robot en el camino es mucho más difícil. TOPReward aborda esto sin diseñar manualmente recompensas ni entrenar otro modelo. En lugar de pedir a un VLM que produzca explícitamente una puntuación de progreso, le pregunta al modelo si se ha completado una tarea y observa directamente las probabilidades que asigna a los posibles tokens de respuesta. Esas probabilidades de token se convierten en una señal de recompensa zero-shot que puede usarse para medir el progreso de la tarea, detectar el éxito y reponder las demostraciones del robot. Lo que hace que la idea sea especialmente interesante es que el modelo de recompensa en sí no fue entrenado explícitamente para ser un modelo de recompensa. Por lo tanto, el artículo plantea una pregunta más amplia: ¿Cuánta supervisión útil ya está oculta dentro de los modelos base si sabemos dónde buscarla? TOPReward también entró en nuestra exploración a través de MolmoAct2, donde se utiliza como señal de recompensa dentro de un pipeline más grande de aprendizaje de robots. Durante la sesión, nos centraremos en tres cosas: cómo funciona realmente TOPReward, cómo se aplica a una política visuomotora relativamente simple como ManiFlow — que no es un VLA — y qué sucede con el rendimiento de la política cuando las demostraciones se reponder usando esta señal. Eso nos da una pregunta interesante más allá de TOPReward en sí: ¿Puede el conocimiento oculto dentro de un VLM mejorar políticas de robots que no utilizan un VLM en absoluto en el momento de la inferencia? Y, como siempre, miraremos más allá de los resultados principales: cuán convincente es la señal de recompensa, qué es lo que realmente capta, dónde podría fallar y qué tan difícil sería reproducir la idea nosotros mismos? No se necesita preparación. Lee el resumen si tienes diez minutos. Todos son bienvenidos — cualquier sea tu área de estudio, donde sea que estudies y cuán poco o mucho hayas hecho de robótica hasta ahora. Ven con preguntas, desacuerdos o tu propia perspectiva sobre cómo deberían usarse los modelos base en el aprendizaje de robots. 🎟️ Solo hay un número limitado de plazas, así que podemos mantener la sesión personal e interactiva. Por favor, regístrate temprano y asiste solo si has recibido un boleto. 📍 Alojado en el Merantix AI Campus. Las puertas abren a las 18:30, comenzamos a las 18:45. 👋 ¿Nuevo aquí? Únete al grupo de la comunidad — todo lo demás se anunciará allí primero.
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.