
🤖🍨 Sundae Robotics 06: V-JEPA 2 y Predicción de Inteligencia Física
Descripción
🤖🍨 Toma un sundae y únete a Sundae Robotics, una serie dominical privada solo por invitación que reúne a investigadores, fundadores y constructores de robótica que trabajan en la frontera de la inteligencia física.Sundae Robotics 06De V-JEPA 2 a Inteligencia Física — Predicción, Planificación y Post-EntrenamientoCharla Destacada: Prediciendo la Inteligencia Física — Daniel DugasV-JEPA 2, Modelos Mundiales Predictivos e Inteligencia Física¿Por qué es la inteligencia tan predictiva? ¿Y cómo construimos sistemas de IA que entienden la realidad física, anticipan lo que sucederá a continuación y utilizan esas predicciones para actuar?Esta sesión explora V-JEPA 2, el modelo de video mundial auto-supervisado de Meta FAIR para comprensión visual, predicción y planificación robótica, como punto de partida para una discusión más amplia sobre inteligencia física predictiva.En lugar de entrenar un modelo para reconstruir cada píxel de un video, V-JEPA 2 aprende a predecir representaciones abstractas de cómo evolucionan las escenas. El objetivo es capturar una estructura predecible de nivel superior: objetos, movimiento, geometría, interacciones y cambios en el estado físico, sin gastar capacidad de modelo reproduciendo cada detalle visual.Esto plantea una pregunta fundamental: ¿qué debería predecir un modelo mundial útil?V-JEPA 2 está preentrenado en video natural a gran escala a través de aprendizaje auto-supervisado, lo que permite al modelo aprender regularidades amplias sobre cómo evoluciona el mundo físico a partir de experiencias visuales pasivas. El modelo puede adaptarse luego con datos de interacción robótica comparativamente limitados, conectando estas representaciones físicas aprendidas con la acción.La hipótesis de escalado más amplia es convincente: en lugar de enseñar a los robots la estructura del mundo físico completamente a través de experiencias encarnadas costosas, podríamos aprender prioridades físicas amplias a partir de abundantes videos humanos y de internet, y utilizar los datos robóticos principalmente para enseñar al modelo cómo sus propias acciones cambian el mundo.Una parte particularmente interesante de V-JEPA 2 es su extensión de la predicción de video pasivo a la planificación robótica condicionada por acciones.En lugar de preguntar solo:¿Qué sucede a continuación?Un modelo mundial robótico puede preguntar:¿Qué sucede a continuación si tomo esta acción?Dada una observación actual, acciones candidatas y un objetivo deseado, el sistema puede razonar sobre posibles estados futuros y seleccionar acciones que muevan el entorno hacia ese objetivo.Esto permite comportamientos como alcanzar, agarrar, manipular objetos previamente no vistos y recoger y colocar imágenes de objetivo como especificaciones de tarea.El trabajo apunta hacia una visión más amplia de los modelos mundiales: sistemas de IA que hacen más que reconocer lo que es actualmente visible. Construyen representaciones internas de cómo se comporta el mundo, predicen futuros posibles, evalúan esos futuros y utilizan predicciones para elegir acciones.Daniel se basará en su trabajo previo en Meta FAIR para discutir lo que surge a medida que los modelos mundiales predictivos se escalan: desde características frente a píxeles, hasta representaciones cruzadas de encarnación, predicción latente y planificación robótica.Desde allí, pasaremos más allá de V-JEPA 2 a una pregunta más grande:Una vez que un modelo puede predecir el futuro, ¿para qué son realmente útiles esas predicciones?Exploraremos una posible descomposición de la inteligencia física en tres componentes interaccionantes:Predicción → Valor → AcciónLa predicción nos dice lo que podría suceder. El valor nos dice qué resultados son deseables. La acción determina cómo hacer que esos resultados ocurran.Conectaremos este marco a la planificación en modelos mundiales aprendidos, incluidos enfoques como WorldPlanner, que combina la predicción visual condicionada por la acción con la Búsqueda de Árbol de Monte Carlo y el Control Predictivo del Modelo.Finalmente, miraremos más allá de la pre-entrenamiento hacia el desafío emergente de IA Física post-entrenamiento.A medida que las recetas de escalado para el pre-entrenamiento de IA fronteriza se establecen cada vez más, los robóticos se enfrentan nuevamente a preguntas sobre el aprendizaje por refuerzo, demostraciones, interacción con el entorno, aprendizaje continuo y el papel de la simulación.El elefante en la habitación:¿Es la simulación indudablemente necesaria, absolutamente inútil o ambas?Discutiremos cómo los modelos mundiales, la simulación, el aprendizaje por refuerzo y la experiencia robótica en el mundo real podrían encajar juntos, y si la IA Física eventualmente desarrollará un paradigma post-entrenamiento análogo al que está surgiendo para los agentes de IA frontera.
Destacados
Lectura Previa• V-JEPA 2: Modelos de Video Auto-Supervisados Habilitan Comprensión, Predicción y Planificaciónhttps://arxiv.org/abs/2506.09985• Meta AI — V-JEPA 2https://ai.meta.com/research/vjepa/• Código + Modelos — V-JEPA 2https://github.com/facebookresearch/vjepa2• La Perspectiva de Rutas sobre el Aprendizaje de Valorhttps://distill.pub/2019/paths-perspective-on-value-learning/TópicosArquitectura + EntrenamientoV-JEPA 2 sigue una receta de dos etapas.Primero, un codificador y un predictor son preentrenados a través del aprendizaje auto-supervisado en video a gran escala.En lugar de intentar generar píxeles faltantes o futuros directamente, el modelo predice representaciones de porciones no vistas o futuras de un video en un espacio latente aprendido.Esto alienta al sistema a enfocarse en estructuras predecibles de nivel superior, como objetos, movimiento, geometría, relaciones espaciales e interacciones físicas, en lugar de gastar capacidad modelando cada detalle visual.La idea central es que una representación útil del mundo físico puede emerger precisamente porque el modelo se ve obligado a responder:¿Qué información sobre el presente es necesaria para predecir el futuro?A escala, esto crea representaciones que pueden apoyar no solo la comprensión visual, sino también la predicción y el razonamiento físico posterior.En segundo lugar, el modelo mundial preentrenado se conecta a la robótica a través de un entrenamiento condicionado por acciones utilizando una cantidad comparativamente pequeña de datos de interacción robótica.Esto enseña al modelo algo que el video pasivo no puede proporcionar directamente:cómo las acciones de un robot afectan los futuros estados del mundo.El modelo resultante puede evaluar acciones candidatas en relación con un estado objetivo deseado, permitiendo la planificación condicionada por objetivos en entornos previamente no vistos.Meta informa que se utilizan 62 horas de datos de interacción robótica del conjunto de datos DROID para esta etapa.El resultado sugiere una posible receta de escalado para la robótica:aprender prioridades físicas amplias a partir de videos abundantes y luego conectar esas representaciones a la acción utilizando cantidades mucho más pequeñas de datos robóticos costosos.Esto separa dos problemas que a menudo se aprenden juntos:¿Cómo funciona el mundo? y ¿Cómo puede actuar este robot dentro de él?De Predicción a PlanificaciónUn modelo mundial se vuelve especialmente interesante cuando sus predicciones se pueden utilizar para elegir acciones.Si un modelo puede predecir cómo podría verse el mundo después de tomar una acción particular, un planificador puede comparar diferentes futuros posibles y elegir acciones que se espera muevan el sistema hacia un objetivo.Esto reformula el control robótico de aprender directamente:Observación → Acciónhacia un bucle más rico:Observación → Predicción → Evaluación → AcciónV-JEPA 2 proporciona un ejemplo de esta transición.También discutiremos WorldPlanner, que aborda el problema de predicción a acción de manera más explícita al combinar un modelo mundial visual condicionado por acción con algoritmos de planificación como Búsqueda de Árbol de Monte Carlo y Control Predictivo del Modelo.Juntas, estas aproximaciones plantean una pregunta más amplia:¿Podría la predicción convertirse en el sustrato computacional sobre el cual se construyen la planificación y el razonamiento físico?Predicción, Valor + AcciónLa predicción por sí sola no determina el comportamiento.Un modelo puede ser capaz de imaginar muchos futuros posibles, pero un agente inteligente debe aún determinar qué futuro desea.Esto motiva una descomposición de la inteligencia física en:Predicción — ¿Qué sucederá? Valor — ¿Qué resultados son deseables? Acción — ¿Qué debería hacer?Daniel discutirá cómo los modelos mundiales predictivos interactúan con el aprendizaje de valor, planificación y control, y si estas capacidades deberían permanecer como componentes separados o eventualmente ser aprendidas conjuntamente dentro de un solo sistema.Esto también conecta la investigación moderna sobre modelos mundiales con ideas más antiguas del aprendizaje por refuerzo y control basado en modelos: buscar a través de futuros posibles, evaluar su valor y seleccionar acciones en consecuencia.IA Física Post-EntrenamientoEl pre-entrenamiento puede enseñar a un modelo representaciones amplias del mundo físico.Pero los agentes físicos capaces aún necesitarán aprender cómo realizar tareas, mejorar a partir de retroalimentación, adaptarse a nuevos entornos y adquirir nuevos comportamientos después del pre-entrenamiento.Eso convierte al post-entrenamiento en un problema central para la IA Física.Los sistemas de IA frontera dependen cada vez más del aprendizaje por refuerzo, interacción con el entorno, experiencia sintética, retroalimentación específica de tareas y resultados verificables después de un pre-entrenamiento a gran escala.La robótica enfrenta un desafío similar, pero la interacción física es dramáticamente más lenta, más cara y más difícil de escalar.Esto hace que la simulación sea difícil de evitar.Al mismo tiempo, los entornos simulados inevitablemente aproximan la realidad.Entonces, ¿qué papel debería desempeñar la simulación?¿Puede el aprendizaje por refuerzo en simulación producir inteligencia física robusta?¿Cuánta experiencia simulada se transfiere a robots reales?¿Pueden los modelos mundiales aprendidos complementar los simuladores de física tradicionales?¿Podrían los modelos predictivos eventualmente generar experiencia imaginada útil para el aprendizaje robótico?¿Y cómo deberían encajar la simulación, las demostraciones, la interacción en el mundo real y la predicción del modelo mundial en una pila de entrenamiento de IA Física escalable?Por qué Es ImportanteLos sistemas de aprendizaje robótico de hoy a menudo dependen de grandes colecciones de demostraciones o interacciones reunidas para tareas, entornos y encarnaciones particulares.Los modelos mundiales predictivos sugieren un camino diferente.Si los modelos pueden adquirir una comprensión física amplia a partir de videos pasivos, los datos de interacción robótica pueden convertirse cada vez más en una forma de enseñar a un modelo cómo actuar, en lugar de obligarlo a aprender la estructura del mundo físico desde cero.V-JEPA 2 es un ejemplo importante de esta idea.Pero la pregunta más amplia va más allá de cualquier arquitectura en particular:¿Puede la predicción convertirse en una base para la inteligencia física?Si los modelos predictivos escalables pueden aprender representaciones útiles de dinámicas, transferir esas representaciones a través de encarnaciones, imaginar las consecuencias de las acciones y apoyar la planificación, pueden convertirse en un componente central de los futuros sistemas robóticos de propósito general.Eso plantea una posibilidad aún mayor: una pila de IA Física en la que un pre-entrenamiento observacional a gran escala proporciona la comprensión del modelo sobre el mundo, mientras que la planificación, el aprendizaje de valor, el aprendizaje por refuerzo, la simulación y un post-entrenamiento robótico relativamente ligero le enseñan cómo operar dentro de ese mundo.Discusión Abierta + Preguntas y Respuestas
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.