
🤖🍨 Робототехника Sundae 05: 3D модели мира, пространственный интеллект и адаптивный ИИ — Принуждение к модальности и цели предварительного обучения 3D
Описание
🤖🍨 Возьмите мороженое и присоединяйтесь к Sundae Robotics, частной серии воскресных встреч по приглашению, собирающей исследователей в области робототехники, основателей и строителей, работающих на передовом крае физического интеллекта.Sundae Robotics 053D мир моделей, пространственный интеллект и адаптивный ИИОсновной доклад: Принуждение к модальности и цели предварительного обучения 3DПонимание 3D мира: Масштабируемые рецепты предварительного и постобучения для адаптивного ИИКлючевой доклад: Бардиенус (Барт) ДуйстерхофСтудент последнего года PhD, Институт робототехники Университета Карнеги-Меллон (Джеффри Ихновски) · World Labs · Сотрудник с Девой РамананомКак мы можем создавать генеративные модели, которые глубоко понимают 3D мир и быстро адаптируются к новым задачам? В этом докладе Барт представит свои недавние достижения в масштабируемом предварительном и постобучении. Сначала он представит новую цель предварительного обучения для изучения 3D динамики. Вдохновленный обучением представлений с масками, данный подход исследует масштабируемое управление для изучения представлений, которые передаются к моделированию мира и обучению имитации.Во-вторых, Барт рассмотрит Принуждение к модальности, рецепт постобучения для извлечения пространственных знаний из моделей генерации изображений. Принуждение к модальности обучает один DiT моделировать совместное распределение между модальностями, устанавливая отдельный уровень шума для каждой модальности. Метод соперничает с самыми лучшими моделями глубины и масштабируется с предварительным обучением текстов-изобразительных.Наконец, Барт обсудит текущую работу по созданию более масштабируемого и адаптивного ИИ. На стороне предварительного обучения он утверждает, что генерация видео является расточительной, что мотивирует поиск более сжатых моделей перехода. Для постобучения он изложит направления к адаптации через задачи за небольшую часть сегодняшних затрат. Вместе эти направления нацелены на будущее, где любой сможет адаптировать мощные открытые модели к новым задачам.Исследования Барта развивают генеративные модели для пространственного интеллекта, охватывающие обучение представлениям 3D/4D и масштабируемые рецепты предварительного и постобучения, которые передаются к нижележащим задачам. Он является студентом последнего года PhD в Институте робототехники Университета Карнеги-Меллон, где его наставляет Джеффри Ихновски, и сотрудничает с Девой Рамананом. В настоящее время он работает над предварительным обучением 3D в World Labs. Его недавние работы включают Принуждение к модальности, которое показало, что предварительное обучение текстов-изображений существенно улучшает 3D восприятие. Барт все больше интересуется основами генерации — как эти модели учатся и как сделать их более адаптивными и эффективными. Он верит в будущее с мощными открытыми моделями, которые можно быстро адаптировать для новых задач, и стремится сделать открытый ИИ полезным для общества.Предварительное чтение• Принуждение к модальности: Извлечение пространственных знаний из моделей генерации изображенийhttps://modality-forcing.github.ioТемы• Масштабируемое предварительное обучение для понимания 3D мира• Изучение передаваемых представлений 3D динамики• Извлечение пространственных знаний из моделей генерации изображений• Обучение представлению 3D/4D для моделирования мира и обучения имитации• Масштабирование пространственного интеллекта с предварительным обучением текстов-изображений• Сжатые модели перехода, выходящие за пределы генерации видео• Эффективное постобучение и адаптация через нижележащие задачи• Открытые и адаптируемые основные моделиОткрытая дискуссия + Вопросы и ответы• Какова правильная цель предварительного обучения для моделей, которым нужно понимать и действовать в 3D мире?• Могут ли треки точек предоставить более масштабируемое представление для моделирования мира, чем пиксели или видео?• Сколько пространственного интеллекта уже заложено в крупных моделях генерации изображений?• Является ли генерация видео неоправданно дорогим способом изучения динамики мира?• Как мощные основные модели могут быть адаптированы к новым задачам за небольшую часть сегодняшних затрат?
Место проведения
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.