Dodaj wydarzenie
Grupa Czytelnicza BRISA 03 - TOPReward

Grupa Czytelnicza BRISA 03 - TOPReward

08 wrz 202618:30 - 20:00 Europe/BerlinBerlin, Germany10 UczestnikówOpen

Opis

Przed naszą oficjalną premierą tej jesieni kontynuujemy naszą serię przedpremierową z kolejną grupą czytelniczą: siadając z artykułem, dobrze go rozumiejąc i pytając, co potrzeba, aby zbudować go samodzielnie. Naszym trzecim artykułem jest TOPReward: Prawdopodobieństwa Tokenów jako Ukryte Nagradzające Zero-Shot dla Robotyki (Chen i in., 2026), które zadaje zaskakująco proste pytanie: Czy wstępnie wytrenowany model językowo-wizualny może już powiedzieć nam, jak dobrze radzi sobie robot — bez trenowania osobnego modelu nagród? W uczeniu robotów łatwo jest stwierdzić, czy zadanie zostało wykonane. Wiedza o tym, jak wiele postępów robi robot w tym procesie, jest znacznie trudniejsza. TOPReward podchodzi do tego bez ręcznego projektowania nagród czy trenowania innego modelu. Zamiast prosić model VLM o jednoznaczne wydanie oceny postępu, pyta model, czy zadanie zostało zakończone i bezpośrednio patrzy na prawdopodobieństwa, które przypisuje możliwym tokenom odpowiedzi. Te prawdopodobieństwa tokenów stają się sygnałem nagrody zero-shot, który można wykorzystać do pomiaru postępu zadania, wykrywania sukcesu i ponownego ważenia demonstracji robotów. To, co czyni ten pomysł szczególnie interesującym, to fakt, że model nagrody nigdy nie był explicite trenowany jako model nagrody. Artykuł zatem stawia szersze pytanie: Ile użytecznej nadzoru jest już ukryte wewnątrz modeli bazowych, jeśli wiemy, gdzie go szukać? TOPReward weszło również do naszego badania przez MolmoAct2, gdzie jest używane jako sygnał nagrody w ramach większego procesu nauki robotów. Podczas sesji skoncentrujemy się na trzech rzeczach: jak działa TOPReward, jak jest stosowane w stosunkowo prostych politykach wizjo-ruchowych, takich jak ManiFlow — które nie jest VLA — oraz co dzieje się z wydajnością polityki, gdy demonstracje są ponownie ważone przy użyciu tego sygnału. To daje nam interesujące pytanie wykraczające poza same TOPReward: Czy wiedza ukryta wewnątrz VLM może poprawić polityki robotów, które w ogóle nie korzystają z VLM w czasie wnioskowania? I, jak zawsze, spojrzymy poza ogólne wyniki: jak przekonujący jest sygnał nagrody, co naprawdę uchwyci, gdzie może zawieść i jak trudne byłoby powtórzenie tego pomysłu samodzielnie? Nie jest wymagana żadna przygotowanie. Przejrzyj streszczenie, jeśli masz dziesięć minut. Wszyscy są mile widziani — niezależnie od tego, co studiujesz, gdzie studiujesz i jak wiele robotyki zrobiłeś do tej pory. Przyjdź z pytaniami, niezgodami lub swoją własną opinią na temat tego, jak modele bazowe powinny być używane w nauce robotów. 🎟️ Mamy tylko ograniczoną liczbę miejsc, aby sesja mogła być osobista i interaktywna. Proszę zarejestruj się wcześnie i przyjdź tylko, jeśli otrzymałeś bilet. 📍 Gospodarzem jest kampus Merantix AI. Drzwi otwierają się o 18:30, zaczynamy o 18:45. 👋 Nowy tutaj? Dołącz do grupy społecznościowej — wszystko inne jest ogłaszane tam jako pierwsze.

Lokalizacja wydarzenia

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Related events

Platforma sztucznej inteligencji

Bezpłatnie
Zarejestruj się za darmo