Enviar evento
🤖🍨 Sundae Robotics 05: Modelos 3D del Mundo, Inteligencia Espacial y IA Adaptativa — Forzado de Modalidades y Objetivos de Pre-entrenamiento 3D

🤖🍨 Sundae Robotics 05: Modelos 3D del Mundo, Inteligencia Espacial y IA Adaptativa — Forzado de Modalidades y Objetivos de Pre-entrenamiento 3D

23 ago. 202614:00 - 17:00 America/Los_AngelesAtherton, United States31 AsistentesOpen

Descripción

🤖🍨 Toma un sundae y únete a Sundae Robotics, una serie privada e invitacional de los domingos que reúne a investigadores, fundadores y constructores de robótica que trabajan en la frontera de la inteligencia física.Sundae Robotics 05 Modelos 3D del Mundo, Inteligencia Espacial y IA Adaptativa Charla Destacada: Forzado de Modalidades y Objetivos de Pre-entrenamiento 3DEntendiendo el Mundo 3D: Recetas escalables de pre-entrenamiento y post-entrenamiento para IA AdaptativaConferencia Principal: Bardienus (Bart) Duisterhof Estudiante de doctorado en su último año, Instituto de Robótica de la Universidad Carnegie Mellon (Jeffrey Ichnowski) · World Labs · Colaborador con Deva Ramanan¿Cómo construimos modelos generativos que comprendan profundamente el mundo 3D y se adapten rápidamente a nuevas tareas? En esta charla, Bart presentará sus recientes contribuciones en recetas escalables de pre-entrenamiento y post-entrenamiento. Primero, presentará un nuevo objetivo de pre-entrenamiento para aprender dinámicas 3D. Inspirado en el aprendizaje de representaciones enmascaradas, el enfoque explora la supervisión escalable para aprender representaciones que se transfieren a la modelación del mundo y el aprendizaje por imitación.En segundo lugar, Bart cubrirá el Forzado de Modalidades, una receta de post-entrenamiento para extraer conocimiento espacial de modelos de generación de imágenes. El Forzado de Modalidades entrena un único DiT para modelar la distribución conjunta entre modalidades al establecer un nivel de ruido separado para cada modalidad. El método compite con los mejores modelos de profundidad y se escala con el pre-entrenamiento de texto a imagen.Finalmente, Bart discutirá el trabajo en curso hacia una IA más escalable y adaptativa. En el lado del pre-entrenamiento, argumentará que la generación de video es derrochadora, lo que motiva la búsqueda de modelos de transición más comprimidos. Para el post-entrenamiento, delineará direcciones hacia la adaptación a través de tareas a una fracción del costo actual. Juntas, estas direcciones buscan un futuro donde cualquiera pueda adaptar poderosos modelos abiertos a nuevas tareas.La investigación de Bart desarrolla modelos generativos para la inteligencia espacial, abarcando el aprendizaje de representaciones 3D/4D y recetas escalables de pre-entrenamiento y post-entrenamiento que se transfieren a tareas posteriores. Es estudiante de doctorado en su último año en el Instituto de Robótica de la Universidad Carnegie Mellon, donde es asesorado por Jeffrey Ichnowski y colabora con Deva Ramanan. Actualmente trabaja en el pre-entrenamiento 3D en World Labs. Su trabajo reciente incluye el Forzado de Modalidades, que demostró que el pre-entrenamiento de texto a imagen mejora sustancialmente la percepción 3D. Bart está cada vez más interesado en los fundamentos de la generación: cómo aprenden estos modelos y cómo hacerlos más adaptables y eficientes. Cree en un futuro con poderosos modelos abiertos que puedan adaptarse rápidamente a nuevas tareas y está apasionado por hacer que la IA abierta sea beneficiosa para la sociedad.Lectura Previa• Forzado de Modalidades: Extrayendo conocimiento espacial de modelos de generación de imágenes https://modality-forcing.github.ioTemas• Pre-entrenamiento escalable para la comprensión del mundo 3D• Aprendiendo representaciones transferibles de dinámicas 3D• Extrayendo conocimiento espacial de modelos de generación de imágenes• Aprendizaje de representaciones 3D/4D para la modelación del mundo y el aprendizaje por imitación• Escalando la inteligencia espacial con el pre-entrenamiento de texto a imagen• Modelos de transición comprimidos más allá de la generación de video• Post-entrenamiento eficiente y adaptación a través de tareas posteriores• Modelos de base abiertos y adaptablesDiscusión Abierta + Preguntas y Respuestas• ¿Cuál es el objetivo de pre-entrenamiento correcto para modelos que necesitan entender y actuar en el mundo 3D?• ¿Pueden las pistas de puntos proporcionar una representación más escalable para la modelación del mundo que píxeles o video?• ¿Cuánta inteligencia espacial ya está latente dentro de los grandes modelos de generación de imágenes?• ¿Es la generación de video una forma innecesariamente costosa de aprender dinámicas del mundo?• ¿Cómo pueden adaptarse modelos de base poderosos a nuevas tareas a una fracción del costo actual?

Ubicación del evento

Dile a tu red que vas a ir

Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.

Related events

Plataforma de inteligencia artificial

Gratis