
Grupa Czytelnicza BRISA 04 - LeWorldModel
Opis
Przed naszym oficjalnym uruchomieniem tej jesieni kontynuujemy naszą serię przedpremierową z kolejną grupą czytelniczą: zasiadamy z artykułem, odpowiednio go rozumiemy i zadajemy pytanie, co byłoby potrzebne, aby zbudować to sami. Nasz czwarty artykuł to LeWorldModel: Stabilna Architektura Przewidywania Wspólnego Osadzenia End-to-End z Pikseli (Maes i in., 2026), który pyta: Jak prosty może stać się model świata, aby nadal być użytecznym do planowania? Modele świata uczą się przewidywać, jak środowisko może się zmieniać pod wpływem różnych działań, co pozwala na porównanie możliwych przyszłości przed podjęciem decyzji. LeWorldModel, czyli LeWM, przyjmuje stosunkowo prostą metodę. Zamiast przewidywać przyszłe obrazy piksel po pikselu, uczy się zwartych reprezentacji sceny i przewiduje, jak ta reprezentacja zmienia się, gdy podejmowane są różne działania. Jednym z głównych wyzwań związanych z tego rodzaju modelem jest zapobieganie zapadaniu się tych wyuczonych reprezentacji podczas treningu. LeWM używa SIGReg do stabilizacji tego procesu, co pozwala na bezpośrednie trenowanie całego modelu z pikseli i działań bez polegania na wstępnie wytrenowanym enkoderze wizualnym. Uzyskany model ma około 15 milionów parametrów, może być trenowany na pojedynczym GPU w ciągu kilku godzin i wykorzystuje swoje wyuczone dynamiki do planowania w kierunku celu. Autorzy raportują planowanie do 48 razy szybciej niż DINO-WM, pozostając jednocześnie konkurencyjnymi w kilku ocenianych zadaniach kontrolnych. Co sprawia, że artykuł jest szczególnie interesujący, to to, jak mało mechanizmów zdaje się potrzebować. Rodzi to możliwość, że stosunkowo małe modele świata mogą być wystarczające do nauki użytecznych dynamik i wspierania efektywnego planowania. Na spotkaniu grupy czytelniczej przyjrzymy się, dlaczego ta stosunkowo prosta metoda działa, czego model tak naprawdę uczy się o swoim środowisku i gdzie ta prostota może zacząć być ograniczeniem. Szerszym pytaniem jest: Jak daleko może skalować zwarty latentny model świata w kierunku rzeczywistej manipulacji robotycznej? Nie jest wymagana żadna przygotowanie. Przejrzyj abstrakt, jeśli masz dziesięć minut. Każdy jest mile widziany — niezależnie od tego, co studiujesz, gdzie studiujesz i ile dotychczas zrobiłeś w dziedzinie robotyki. Przyjdź z pytaniami, niezgodami lub własnym spojrzeniem na to, co model świata dla robotyki powinien faktycznie nauczyć się. 🎟️ Jest ograniczona liczba miejsc, więc możemy utrzymać sesję osobistą i interaktywną. Proszę o wczesną rejestrację i obecność tylko w przypadku otrzymania biletu. 📍 Gospodarz w Merantix AI Campus. Drzwi otwarte o 18:30, zaczynamy o 18:45. 👋 Jesteś nowy? Dołącz do grupy społecznościowej — wszystko inne ogłaszane jest tam jako pierwsze.
Lokalizacja wydarzenia
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.