
BRISA Lesegruppe 04 - LeWorldModel
Beschreibung
Vor unserem offiziellen Start in diesem Herbst setzen wir unsere Pre-Launch-Serie mit einer weiteren Lesegruppe fort: Wir setzen uns mit einem Paper auseinander, verstehen es richtig und fragen uns, was nötig wäre, um es selbst zu bauen. Unser viertes Paper ist LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels (Maes et al., 2026), das fragt: Wie einfach kann ein Weltmodell werden, während es weiterhin nützlich für die Planung ist? Weltmodelle lernen vorherzusagen, wie sich eine Umgebung unter verschiedenen Aktionen ändern könnte, was es ermöglicht, mögliche Zukunftsszenarien zu vergleichen, bevor man handelt. LeWorldModel, oder LeWM, verfolgt einen relativ einfachen Ansatz. Anstatt zukünftige Bilder Pixel für Pixel vorherzusagen, lernt es eine kompakte Darstellung der Szene und sagt voraus, wie sich diese Darstellung verändert, wenn unterschiedliche Aktionen ausgeführt werden. Eines der Hauptprobleme bei dieser Art von Modell besteht darin, das Zusammenbrechen der gelernten Darstellungen während des Trainings zu verhindern. LeWM verwendet SIGReg, um diesen Prozess zu stabilisieren, sodass das gesamte Modell direkt aus Pixeln und Aktionen trainiert werden kann, ohne auf einen vortrainierten visuellen Encoder angewiesen zu sein. Das resultierende Modell hat etwa 15 Millionen Parameter, kann auf einer einzelnen GPU in wenigen Stunden trainiert werden und verwendet seine gelernten Dynamiken, um auf ein Ziel zuzusteuern. Die Autoren berichten von einer Planung, die bis zu 48× schneller ist als DINO-WM, während sie in mehreren der evaluierten Kontrollaufgaben wettbewerbsfähig bleibt. Was das Paper besonders interessant macht, ist, wie wenig Technik es zu benötigen scheint. Es wirft die Möglichkeit auf, dass relativ kleine Weltmodelle bereits ausreichend sein könnten, um nützliche Dynamiken zu lernen und effektive Planung zu unterstützen. In der Lesegruppe werden wir uns anschauen, warum dieser relativ einfache Ansatz funktioniert, was das Modell tatsächlich über seine Umgebung lernt und wo diese Einfachheit möglicherweise zu einer Einschränkung wird. Die grundlegende Frage ist: Wie weit kann ein kompaktes latentes Weltmodell wie dieses in Richtung echter robotischer Manipulation skalieren? Keine Vorbereitung nötig. Überfliegen Sie das Abstract, wenn Sie zehn Minuten Zeit haben. Alle sind willkommen — egal, was Sie studieren, wo Sie studieren und wie viel Robotik Sie bisher gemacht haben. Bringen Sie Fragen, Meinungsverschiedenheiten oder Ihre eigene Sichtweise mit, was ein Weltmodell für Robotik tatsächlich lernen sollte. 🎟️ Es gibt nur eine begrenzte Anzahl von Plätzen, damit wir die Sitzung persönlich und interaktiv gestalten können. Bitte registrieren Sie sich frühzeitig und nehmen Sie nur teil, wenn Sie ein Ticket erhalten haben. 📍 Veranstaltet am Merantix AI Campus. Die Türen öffnen um 18:30 Uhr, wir beginnen um 18:45 Uhr. 👋 Neu hier? Treten Sie der Gemeinschaftsgruppe bei — alles andere wird dort zuerst bekannt gegeben.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.