Soumettre un événement
🤖🍨 Sundae Robotics 06 : V-JEPA 2 et la Prédiction de l'Intelligence Physique

🤖🍨 Sundae Robotics 06 : V-JEPA 2 et la Prédiction de l'Intelligence Physique

30 août 202614:00 - 17:00 America/Los_AngelesAtherton, United States68 ParticipantsOpen

Description

🤖🍨 Prenez un sundae et rejoignez Sundae Robotics, une série privée sur invitation seulement qui réunit des chercheurs, fondateurs et constructeurs en robotique travaillant à la pointe de l'intelligence physique.Sundae Robotics 06De V-JEPA 2 à l'Intelligence Physique — Prédiction, Planification & Post-FormationConférence en vedette : Prédire l'Intelligence Physique — Daniel DugasV-JEPA 2, Modèles Mondiaux Prédictifs & Intelligence PhysiquePourquoi l'intelligence est-elle si prédictive ? Et comment construisons-nous des systèmes d'IA qui comprennent la réalité physique, anticipent ce qui se passe ensuite et utilisent ces prédictions pour agir ?Cette session explore V-JEPA 2, le modèle de monde vidéo auto-supervisé de Meta FAIR pour la compréhension visuelle, la prédiction et la planification robotique, comme point de départ d'une discussion plus large sur l'intelligence physique prédictive.Au lieu de former un modèle à reconstruire chaque pixel d'une vidéo, V-JEPA 2 apprend à prédire des représentations abstraites de l'évolution des scènes. L'objectif est de capturer une structure prévisible de niveau supérieur — objets, mouvements, géométrie, interactions et changements d'état physique — sans consacrer la capacité du modèle à reproduire chaque détail visuel.Cela soulève une question fondamentale : que devrait réellement prédire un modèle de monde utile ?V-JEPA 2 est pré-entraîné sur des vidéos naturelles à grande échelle grâce à l'apprentissage auto-supervisé, permettant au modèle d'apprendre des régularités larges sur la façon dont le monde physique évolue à partir d'une expérience visuelle passive. Le modèle peut alors être adapté avec des données d'interaction robotique relativement limitées, reliant ces représentations physiques apprises à l'action.La théorie de l'élargissement est convaincante : plutôt que d'apprendre aux robots la structure du monde physique entièrement par une expérience incarnée coûteuse, nous pourrions être capables d'apprendre de larges priorités physiques à partir de vidéos humaines et internet abondantes — et d'utiliser les données robotiques principalement pour enseigner au modèle comment ses propres actions changent le monde.Une partie particulièrement intéressante de V-JEPA 2 est son extension de la prédiction vidéo passive à la planification robotique conditionnée par l'action.Au lieu de demander seulement :Que se passe-t-il ensuite ?un modèle de monde robotique peut demander :Que se passe-t-il ensuite si je prends cette action ?Étant donné une observation actuelle, des actions candidates et un objectif désiré, le système peut raisonner sur les états futurs possibles et sélectionner des actions qui déplacent l'environnement vers cet objectif.Cela permet des comportements tels que l'atteinte, la saisie, la manipulation d'objets jamais vus auparavant et le pick-and-place en utilisant des images cibles comme spécifications de tâche.Ce travail pointe vers une vision plus large des modèles de monde : des systèmes d'IA qui font plus que reconnaître ce qui est actuellement visible. Ils construisent des représentations internes de la façon dont le monde se comporte, prédisent de futurs possibles, évaluent ces futurs et utilisent les prédictions pour choisir des actions.Daniel s'appuiera sur ses travaux précédents chez Meta FAIR pour discuter de ce qui émerge à mesure que les modèles mondiaux prédictifs s'élargissent - des caractéristiques par rapport aux pixels, aux représentations de croisement, à la prédiction latente et à la planification robotique.De là, nous passerons au-delà de V-JEPA 2 à une question plus large :Une fois qu'un modèle peut prédire l'avenir, à quoi servent réellement ces prédictions ?Nous explorerons une possible décomposition de l'intelligence physique en trois composants interactifs :Prédiction → Valeur → ActionLa prédiction nous dit ce qui pourrait arriver. La valeur nous dit quels résultats sont souhaitables. L'action détermine comment faire en sorte que ces résultats se produisent.Nous relierons ce cadre à la planification dans les modèles mondiaux appris, y compris des approches telles que WorldPlanner, qui combine la prédiction visuelle conditionnée par l'action avec la recherche d'arbre Monte Carlo et le contrôle prédictif du modèle.Enfin, nous examinerons au-delà de la pré-formation vers le défi émergent de l'IA Physique après formation.À mesure que les recettes d'élargissement pour la pré-formation de l'IA à la frontière deviennent de plus en plus établies, les roboticiens se confrontent à nouveau à des questions autour de l'apprentissage par renforcement, des démonstrations, de l'interaction avec l'environnement, de l'apprentissage continu et du rôle de la simulation.L'éléphant dans la pièce :La simulation est-elle indéniablement nécessaire, complètement désespérée, ou les deux ?Nous discuterons de la façon dont les modèles mondiaux, la simulation, l'apprentissage par renforcement et l'expérience robotique du monde réel pourraient s'imbriquer — et si l'IA Physique finira par développer un paradigme post-formation analogue à celui qui émerge pour les agents d'IA à la frontière.Pré-lecture• V-JEPA 2 : Les Modèles Vidéo Auto-Supervisés Permettent Compréhension, Prédiction et Planification https://arxiv.org/abs/2506.09985• Meta AI — V-JEPA 2 https://ai.meta.com/research/vjepa/• Code + Modèles — V-JEPA 2 https://github.com/facebookresearch/vjepa2• La Perspective des Chemins sur l'Apprentissage de la Valeur https://distill.pub/2019/paths-perspective-on-value-learning/

Lieu de l`événement

Faites savoir à votre réseau que vous y allez

Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.

Related events

Plateforme d’intelligence artificielle

Gratuit