Enviar evento
Grupo de Leitura BRISA 03 - TOPReward

Grupo de Leitura BRISA 03 - TOPReward

08 set 202618:30 - 20:00 Europe/BerlinBerlin, Germany10 ParticipantesOpen

Descrição

Antes do nosso lançamento oficial neste outono, estamos dando continuidade à nossa série de pré-lançamento com mais um grupo de leitura: sentando-se com um artigo, entendendo-o corretamente e perguntando o que seria necessário para construí-lo nós mesmos. Nosso terceiro artigo é TOPReward: Probabilidades de Tokens como Recompensas Ocultas Zero-Shot para Robótica (Chen et al., 2026), que faz uma pergunta surpreendentemente simples: Um Modelo de Visão-Linguagem pré-treinado já pode nos dizer o quão bem um robô está se saindo — sem treinar um modelo de recompensa separado? Na aprendizagem de robôs, saber se uma tarefa foi concluída é relativamente fácil. Saber quanto progresso o robô está fazendo ao longo do caminho é muito mais difícil. TOPReward aborda isso sem projetar recompensas manualmente ou treinar outro modelo. Em vez de pedir a um VLM para gerar explicitamente uma pontuação de progresso, pede ao modelo se uma tarefa foi concluída e observa diretamente as probabilidades que ele atribui aos possíveis tokens de resposta. Essas probabilidades de tokens se tornam um sinal de recompensa zero-shot que pode ser usado para medir o progresso da tarefa, detectar sucesso e reponderar demonstrações de robô. O que torna a ideia especialmente interessante é que o próprio modelo de recompensa nunca foi explicitamente treinado para ser um modelo de recompensa. O artigo, portanto, levanta uma questão mais ampla: Quanta supervisão útil já está escondida dentro dos modelos fundamentais se soubermos onde procurar? TOPReward também entrou em nossa exploração através do MolmoAct2, onde é usado como um sinal de recompensa dentro de um pipeline maior de aprendizagem de robôs. Durante a sessão, vamos nos concentrar em três coisas: como o TOPReward realmente funciona, como ele é aplicado a uma política visuomotora relativamente simples como o ManiFlow — que não é um VLA — e o que acontece com o desempenho da política quando as demonstrações são reponderadas usando esse sinal. Isso nos dá uma pergunta interessante além do próprio TOPReward: O conhecimento escondido dentro de um VLM pode melhorar políticas de robô que não usam um VLM em tempo de inferência? E, como sempre, vamos olhar além dos resultados principais: quão convincente é o sinal de recompensa, o que ele realmente capta, onde ele pode falhar e quão difícil seria reproduzir a ideia nós mesmos? Nenhuma preparação necessária. Dê uma olhada no resumo se você tiver dez minutos. Todos são bem-vindos — seja qual for o que você estuda, onde quer que estude e quanta robótica você tenha feito até agora. Venha com perguntas, desacordos ou sua própria visão sobre como os modelos fundamentais devem ser usados na aprendizagem de robôs. 🎟️ Há apenas um número limitado de vagas, para que possamos manter a sessão pessoal e interativa. Por favor, registre-se cedo e apenas participe se você recebeu um ingresso. 📍 Hospedado no Merantix AI Campus. As portas abrem às 18h30, começamos às 18h45. 👋 Novo aqui? Junte-se ao grupo da comunidade — tudo o que mais é anunciado primeiro lá.

Localização do evento

Diga à sua rede que vai participar

Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.

Related events

Plataforma de inteligência artificial

Gratuito
Registar gratuitamente