Enviar evento
🤖🍨 Sundae Robotics 05: Modelos de Mundo 3D, Inteligência Espacial e IA Adaptativa — Forçando Modalidade e Objetivos de Pré-treinamento 3D

🤖🍨 Sundae Robotics 05: Modelos de Mundo 3D, Inteligência Espacial e IA Adaptativa — Forçando Modalidade e Objetivos de Pré-treinamento 3D

23 ago 202614:00 - 17:00 America/Los_AngelesAtherton, United States31 ParticipantesOpen

Descrição

🤖🍨 Pegue um sundae e junte-se à Sundae Robotics, uma série de domingos privada e apenas por convite, reunindo pesquisadores de robótica, fundadores e construtores que trabalham na fronteira da inteligência física.Sundae Robotics 053D Modelos de Mundo, Inteligência Espacial e IA AdaptativaPalestra em Destaque: Forçando Modalidade e Objetivos de Pré-treinamento 3DEntendendo o Mundo 3D: Receitas Escaláveis de Pré e Pós-treinamento para IA AdaptativaPalestra Principal: Bardienus (Bart) DuisterhofEstudante de doutorado no último ano, Carnegie Mellon University Robotics Institute (Jeffrey Ichnowski) · World Labs · Colaborador de Deva RamananComo construímos modelos generativos que compreendem profundamente o mundo 3D e se adaptam rapidamente a novas tarefas? Nesta palestra, Bart apresentará suas contribuições recentes em receitas escaláveis de pré-treinamento e pós-treinamento. Primeiro, ele apresentará um novo objetivo de pré-treinamento para aprender dinâmicas 3D. Inspirado pelo aprendizado de representações mascaradas, a abordagem explora supervisão escalável para aprender representações que transferem para modelagem de mundo a jusante e aprendizado por imitação.Em segundo lugar, Bart abordará o Forçando Modalidade, uma receita de pós-treinamento para extrair conhecimento espacial de modelos de geração de imagens. Forçando Modalidade treina um único DiT para modelar a distribuição conjunta entre modalidades ao definir um nível de ruído separado para cada modalidade. O método compete com os melhores modelos de profundidade e se escala com pré-treinamento de texto para imagem.Por fim, Bart discutirá trabalhos em andamento em direção a uma IA mais escalável e adaptativa. Do lado do pré-treinamento, ele argumentará que a geração de vídeo é desperdício, motivando a busca por modelos de transição mais compactos. Para o pós-treinamento, ele delineará direções para adaptação entre tarefas a uma fração do custo atual. Juntas, essas direções visam um futuro onde qualquer um possa adaptar modelos abertos poderosos a novas tarefas.A pesquisa de Bart desenvolve modelos generativos para inteligência espacial, abrangendo aprendizado de representações 3D/4D e receitas escaláveis de pré e pós-treinamento que transferem para tarefas a jusante. Ele é um estudante de doutorado no último ano no Robotics Institute da Carnegie Mellon University, onde é orientado por Jeffrey Ichnowski e colabora com Deva Ramanan. Atualmente, trabalha em pré-treinamento 3D na World Labs. Seu trabalho recente inclui Forçando Modalidade, que mostrou que o pré-treinamento de texto para imagem melhora substancialmente a percepção 3D. Bart está cada vez mais interessado nas bases da geração — como esses modelos aprendem e como torná-los mais adaptáveis e eficientes. Ele acredita em um futuro com modelos abertos poderosos que possam ser rapidamente adaptados para novas tarefas e é apaixonado por tornar a IA aberta benéfica para a sociedade.Pré-Leitura• Forçando Modalidade: Extraindo conhecimento espacial de modelos de geração de imagenshttps://modality-forcing.github.ioTópicos• Pré-treinamento escalável para compreensão do mundo 3D• Aprendendo representações transferíveis de dinâmicas 3D• Extraindo conhecimento espacial de modelos de geração de imagens• Aprendizado de representações 3D/4D para modelagem de mundo e aprendizado por imitação• Escalando a inteligência espacial com pré-treinamento de texto para imagem• Modelos de transição compactados além da geração de vídeo• Pós-treinamento eficiente e adaptação entre tarefas a jusante• Modelos fundacionais abertos e adaptáveisDiscussão Aberta + Q&A• Qual é o objetivo de pré-treinamento correto para modelos que precisam entender e agir no mundo 3D?• Podem trilhas de pontos fornecer uma representação mais escalável para modelagem do mundo do que pixels ou vídeo?• Quanta inteligência espacial já está latente dentro de grandes modelos de geração de imagens?• A geração de vídeo é uma maneira desnecessariamente cara de aprender dinâmicas de mundo?• Como modelos fundacionais poderosos podem ser adaptados a novas tarefas a uma fração do custo atual?

Localização do evento

Diga à sua rede que vai participar

Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.

Related events

Plataforma de inteligência artificial

Gratuito