Dodaj wydarzenie
🤖🍨 Sundae Robotics 05: Modele Świata 3D, Inteligencja Przestrzenna i Adaptacyjna AI — Wymuszanie Modalności i Cele Wstępnego Szkolenia 3D

🤖🍨 Sundae Robotics 05: Modele Świata 3D, Inteligencja Przestrzenna i Adaptacyjna AI — Wymuszanie Modalności i Cele Wstępnego Szkolenia 3D

23 sie 202614:00 - 17:00 America/Los_AngelesAtherton, United States31 UczestnikówOpen

Opis

🤖🍨 Weź sobie sundae i dołącz do Sundae Robotics, prywatnej serii spotkań w każdą niedzielę, które gromadzą badaczy robotyki, założycieli i twórców pracujących na granicy inteligencji fizycznej.Sundae Robotics 05 Modele Świata 3D, Inteligencja Przestrzenna i Adaptacyjna AI Wykład Gościnny: Wymuszanie Modalności i Cele Wstępnego Szkolenia 3DRozumienie Świata 3D: Skalable Przepisy Wstępnego i Po-Wstępnego Szkolenia dla Adaptacyjnej AIWykład: Bardienus (Bart) Duisterhof Doktorant ostatniego roku, Instytut Robotyki Uniwersytetu Carnegie Mellon (Jeffrey Ichnowski) · World Labs · Współpraca z Devą RamananJak budujemy modele generatywne, które głęboko rozumieją świat 3D i szybko dostosowują się do nowych zadań? W tym wykładzie Bart przedstawi swoje ostatnie osiągnięcia w zakresie skalowalnych przepisów wstępnego i po-wstępnego szkolenia. Najpierw zaprezentuje nowy cel wstępnego szkolenia do nauki dynamiki 3D. Zainspirowane nauką reprezentacji z maskowaniem, podejście to bada skalowalną superwizję w celu nauki reprezentacji, które przenoszą się na dalsze modelowanie świata i naukę naśladowania.Następnie Bart omówi Wymuszanie Modalności, przepis po-wstępnego szkolenia w celu wydobycia wiedzy przestrzennej z modeli generacji obrazów. Wymuszanie Modalności trenuje pojedynczy DiT, aby modelować wspólny rozkład między modalnościami, ustawiając oddzielny poziom szumów dla каждой modalności. Metoda ta konkuruje z najlepszymi modelami głębokości i skaluje się przy wstępnym szkoleniu tekst-do-obrazu.Na koniec Bart omówi bieżące prace nad bardziej skalowalną i adaptacyjną AI. Po stronie wstępnego szkolenia będzie argumentował, że generacja wideo jest nieefektywna, co motywuje poszukiwanie bardziej skompresowanych modeli przejść. W przypadku po-wstępnego szkolenia przedstawi kierunki w kierunku adaptacji między zadaniami przy ułamku dzisiejszych kosztów. Razem te kierunki mają na celu przyszłość, w której każdy będzie mógł dostosować potężne otwarte modele do nowych zadań.Badania Barta rozwijają modele generatywne dla inteligencji przestrzennej, obejmujące naukę reprezentacji 3D/4D oraz skalowalne przepisy wstępnego i po-wstępnego szkolenia, które przenoszą się na dalsze zadania. Jest on doktorantem ostatniego roku w Instytucie Robotyki Uniwersytetu Carnegie Mellon, gdzie jego opiekunem jest Jeffrey Ichnowski, a współpracuje z Devą Ramanan. Obecnie pracuje nad wstępnym szkoleniem 3D w World Labs. Jego ostatnia praca obejmuje Wymuszanie Modalności, które wykazało, że wstępne szkolenie tekst-do-obrazu znacznie poprawia percepcję 3D. Bart coraz bardziej interesuje się podstawami generacji — jak te modele się uczą i jak uczynić je bardziej adaptacyjnymi i efektywnymi. Wierzy w przyszłość z potężnymi otwartymi modelami, które można szybko dostosować do nowych zadań, oraz pasjonuje się tym, aby otwarta AI była korzystna dla społeczeństwa.Leitura Wstępna• Wymuszanie Modalności: Wydobywanie wiedzy przestrzennej z modeli generacji obrazów https://modality-forcing.github.ioTematy• Skalable wstępne szkolenie dla zrozumienia świata 3D• Nauka przenośnych reprezentacji dynamiki 3D• Wydobywanie wiedzy przestrzennej z modeli generacji obrazów• Nauka reprezentacji 3D/4D dla modelowania świata i nauki naśladowania• Skalowanie inteligencji przestrzennej przy wstępnym szkoleniu tekst-do-obrazu• Skompresowane modele przejść poza generację wideo• Efektywne po-wstępne szkolenie i adaptacja między dalszymi zadaniami• Otwarte i adaptacyjne modele bazoweOtwarte Dyskusje + Pytania i Odpowiedzi• Jaki jest odpowiedni cel wstępnego szkolenia dla modeli, które muszą rozumieć i działać w świecie 3D?• Czy ślady punktowe mogą zapewnić bardziej skalowalną reprezentację dla modelowania świata niż piksele lub wideo?• Ile inteligencji przestrzennej już ukrytej jest w dużych modelach generacji obrazów?• Czy generacja wideo jest niepotrzebnie drogą metodą nauki dynamiki świata?• Jak potężne modele bazowe mogą być dostosowane do nowych zadań przy ułamku dzisiejszych kosztów?

Lokalizacja wydarzenia

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Related events

Platforma sztucznej inteligencji

Bezpłatnie