Veranstaltung einreichen
BRISA Lesegruppe 03 - TOPReward

BRISA Lesegruppe 03 - TOPReward

08 Sep 202618:30 - 20:00 Europe/BerlinBerlin, Germany10 TeilnehmerOpen

Beschreibung

Vor unserem offiziellen Launch in diesem Herbst setzen wir unsere Pre-Launch-Serie mit einer weiteren Lesegruppe fort: Wir setzen uns mit einem Papier auseinander, verstehen es richtig und fragen, was nötig wäre, um es selbst zu erstellen. Unser drittes Papier ist TOPReward: Token-Wahrscheinlichkeiten als verborgene Nullshot-Belohnungen für Robotik (Chen et al., 2026), das eine überraschend einfache Frage stellt: Kann ein vortrainiertes Vision-Language-Modell uns bereits sagen, wie gut ein Roboter abschneidet — ohne ein separates Belohnungsmodell zu trainieren? Im Roboterlernen ist es relativ einfach zu wissen, ob eine Aufgabe abgeschlossen wurde. Zu wissen, wie viel Fortschritt der Roboter auf dem Weg macht, ist jedoch viel schwieriger. TOPReward geht dies an, ohne manuell Belohnungen zu entwerfen oder ein weiteres Modell zu trainieren. Anstatt ein VLM zu bitten, einen Fortschrittswert explizit auszugeben, fragt es das Modell, ob eine Aufgabe abgeschlossen wurde, und blickt direkt auf die Wahrscheinlichkeiten, die es den möglichen Antwort-Token zuweist. Diese Token-Wahrscheinlichkeiten werden zu einem Nullshot-Belohnungssignal, das verwendet werden kann, um den Fortschritt der Aufgabe zu messen, Erfolge zu erkennen und Roboter-Demonstrationen neu zu gewichten. Was die Idee besonders interessant macht, ist, dass das Belohnungsmodell selbst nie explizit als Belohnungsmodell trainiert wurde. Das Papier wirft daher eine umfassendere Frage auf: Wie viel nützliche Überwachung ist bereits in Grundmodellen verborgen, wenn wir wissen, wo wir danach suchen müssen? TOPReward trat auch durch MolmoAct2 in unsere Erkundung ein, wo es als Belohnungssignal innerhalb einer größeren Robotik-Lernpipeline verwendet wird. Während der Sitzung werden wir uns auf drei Dinge konzentrieren: wie TOPReward tatsächlich funktioniert, wie es auf eine relativ einfache visuomotorische Politik wie ManiFlow — die kein VLA ist — angewendet wird und was mit der Politikleistung passiert, wenn Demonstrationen mit diesem Signal neu gewichtet werden. Das gibt uns eine interessante Frage über TOPReward hinaus: Kann Wissen, das in einem VLM verborgen ist, Roboterrichtlinien verbessern, die bei der Inferenzzeit überhaupt kein VLM nutzen? Und wie immer werden wir über die Schlagzeilen hinausblicken: Wie überzeugend ist das Belohnungssignal, was erfasst es tatsächlich, wo könnte es scheitern und wie schwierig wäre es, die Idee selbst zu reproduzieren? Keine Vorbereitung notwendig. Überfliegen Sie das Abstract, wenn Sie zehn Minuten Zeit haben. Jeder ist willkommen — unabhängig davon, was Sie studieren, wo Sie studieren und wie viel Robotik Sie bisher gemacht haben. Kommt mit Fragen, Meinungsverschiedenheiten oder Ihrem eigenen Ansatz, wie Grundmodelle im Robotiklernen eingesetzt werden sollten. 🎟️ Es gibt nur eine begrenzte Anzahl an Plätzen, damit wir die Sitzung persönlich und interaktiv gestalten können. Bitte melden Sie sich frühzeitig an und nehmen Sie nur teil, wenn Sie ein Ticket erhalten haben. 📍 Veranstaltet am Merantix AI Campus. Die Türen öffnen um 18:30, wir beginnen um 18:45. 👋 Neu hier? Treten Sie der Gemeinschaftsgruppe bei — alles andere wird dort zuerst angekündigt.

Veranstaltungsort

Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind

Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.

Related events

Plattform für künstliche Intelligenz

Kostenlos
Kostenlos registrieren