Soumettre un événement
🤖🍨 Sundae Robotics 05 : Modèles de Monde 3D, Intelligence Spatiale et IA Adaptative — Forçage de Modalité et Objectifs de Pré-entraînement 3D

🤖🍨 Sundae Robotics 05 : Modèles de Monde 3D, Intelligence Spatiale et IA Adaptative — Forçage de Modalité et Objectifs de Pré-entraînement 3D

23 août 202614:00 - 17:00 America/Los_AngelesAtherton, United States31 ParticipantsOpen

Description

🤖🍨 Prenez une glace et rejoignez Sundae Robotics, une série privée sur invitation seulement qui réunit des chercheurs, fondateurs et constructeurs en robotique travaillant à la frontière de l'intelligence physique.Sundae Robotics 05 Modèles de Monde 3D, Intelligence Spatiale & IA Adaptative Conférence Vedette : Forçage de Modalité & Objectifs de Pré-entraînement 3DComprendre le Monde 3D : Recettes de Pré- et Post-entraînement Scalable pour l'IA AdaptativeAllocution Principale : Bardienus (Bart) Duisterhof Étudiant en dernière année de doctorat, Institut de Robotique de l'Université Carnegie Mellon (Jeffrey Ichnowski) · World Labs · Collaborateur avec Deva RamananComment construisons-nous des modèles génératifs qui comprennent profondément le monde en 3D et s'adaptent rapidement à de nouvelles tâches ? Lors de cette présentation, Bart présentera ses contributions récentes dans les recettes de pré-entraînement et de post-entraînement scalables. D'abord, il présentera un nouvel objectif de pré-entraînement pour apprendre la dynamique 3D. Inspiré par l'apprentissage de représentations masquées, l'approche explore une supervision scalable pour apprendre des représentations qui se transfèrent à la modélisation du monde en aval et à l'apprentissage par imitation.Ensuite, Bart couvrira le Forçage de Modalité, une recette de post-entraînement pour extraire des connaissances spatiales des modèles de génération d'images. Le Forçage de Modalité entraîne un seul DiT à modéliser la distribution conjointe entre les modalités en fixant un niveau de bruit séparé pour chaque modalité. Cette méthode rivalise avec les meilleurs modèles de profondeur et évolue avec le pré-entraînement texte-image.Enfin, Bart discutera des travaux en cours en vue d'une IA plus scalable et adaptative. Du côté du pré-entraînement, il soutiendra que la génération vidéo est coûteuse, ce qui motive la recherche de modèles de transition plus compressés. Pour le post-entraînement, il exposera les directions vers l'adaptation à travers les tâches à un coût inférieur à celui d'aujourd'hui. Ensemble, ces directions visent un avenir où chacun peut adapter des modèles ouverts puissants à de nouvelles tâches.La recherche de Bart développe des modèles génératifs pour l'intelligence spatiale, englobant l'apprentissage de représentations 3D/4D et des recettes de pré- et post-entraînement scalables qui se transfèrent aux tâches en aval. Il est étudiant en dernière année de doctorat à l'Institut de Robotique de l'Université Carnegie Mellon, où il est conseillé par Jeffrey Ichnowski et collabore avec Deva Ramanan. Il travaille actuellement sur le pré-entraînement 3D chez World Labs. Ses travaux récents incluent le Forçage de Modalité, qui a montré que le pré-entraînement texte-image améliore considérablement la perception 3D. Bart s'intéresse de plus en plus aux fondements de la génération — comment ces modèles apprennent et comment les rendre plus adaptables et efficaces. Il croit en un avenir avec des modèles ouverts puissants qui peuvent être rapidement adaptés à de nouvelles tâches et est passionné par le fait de rendre l'IA ouverte bénéfique pour la société.Pré-lecture• Forçage de Modalité : Extraction de connaissances spatiales des modèles de génération d'images https://modality-forcing.github.ioThèmes• Pré-entraînement scalable pour la compréhension du monde 3D• Apprentissage de représentations transférables des dynamiques 3D• Extraction de connaissances spatiales à partir de modèles de génération d'images• Apprentissage de représentations 3D/4D pour la modélisation du monde et l'apprentissage par imitation• Élargir l'intelligence spatiale avec le pré-entraînement texte-image• Modèles de transition compressés au-delà de la génération vidéo• Post-entraînement efficace et adaptation à travers les tâches en aval• Modèles de fondation ouverts et adaptablesDiscussion Ouverte + Q&R• Quel est l'objectif de pré-entraînement adéquat pour les modèles qui doivent comprendre et agir dans le monde 3D ?• Les pistes de points peuvent-elles fournir une représentation plus scalable pour la modélisation du monde que les pixels ou la vidéo ?• Quelle intelligence spatiale est déjà latente dans de grands modèles de génération d'images ?• La génération vidéo est-elle un moyen inutilement coûteux d'apprendre les dynamiques du monde ?• Comment les modèles de fondation puissants peuvent-ils être adaptés à de nouvelles tâches à une fraction du coût actuel ?

Lieu de l`événement

Faites savoir à votre réseau que vous y allez

Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.

Related events

Plateforme d’intelligence artificielle

Gratuit