Enviar evento
Clube de Leitura de Artigos do Learning Layer - Semana 33 - SlopCodeBench

Clube de Leitura de Artigos do Learning Layer - Semana 33 - SlopCodeBench

22 set 202617:30 - 19:30 America/Los_AngelesSan Francisco, United States20 ParticipantesOpen

Descrição

O artigo desta semana:SlopCodeBench: Avaliando como Agentes de Código se Degradam ao Longo de Tarefas Iterativas de Longo Prazo Link: https://arxiv.org/abs/2603.24755Site: https://www.scbench.ai/Código: https://github.com/SprocketLab/slop-code-bench Resumo: Quase todos os benchmarks de codificação pedem a um agente que resolva um problema uma vez, do zero. O software real não é construído dessa maneira — ele é estendido, repetidamente, por alguém que trabalha em cima de um código que já existe. Uma configuração de um único teste oculta a coisa com que os praticantes realmente se preocupam: não se um agente pode passar um teste hoje, mas como é o seu código após vinte rodadas de "agora também gerencie isso." O SlopCodeBench mede isso. É um benchmark de 36 problemas e 196 checkpoints nos quais um agente estende repetidamente sua própria solução anterior à medida que novos requisitos surgem. As especificações descrevem deliberadamente apenas o comportamento externo — um contrato de CLI ou API — e não dizem nada sobre arquitetura, assinaturas de funções ou limites de módulo, assim as decisões de design inicial são próprias do agente e se acumulam ao longo da execução. A suíte de testes permanece oculta para que não possa vazar dicas estruturais. Juntamente com a correção, os autores monitoram duas formas de degradação: erosão estrutural (complexidade concentrando em funções já complexas) e verbosidade (crescimento de código redundante e duplicado). Os resultados são sombrios. Ao longo de 15 agentes de codificação abertos e fechados, nenhum resolve completamente um único problema de ponta a ponta, e o melhor passa 14,8% dos checkpoints. A qualidade cai à medida que as trajetórias se alongam: a erosão estrutural aumenta em 77% das execuções e a verbosidade em 75,5%. A comparação que dá nome ao artigo: medido em relação a 473 repositórios Python de código aberto, o código do agente é 2,3x mais verboso e 2,0x mais erodido, e os repositórios humanos se degradam com menos frequência e por margens menores em suas histórias do git. Dizer explicitamente ao agente para escrever código limpo reduz a verbosidade e erosão iniciais em até um terço — mas não muda a taxa de degradação. Relevante para qualquer um que entregue código com um agente no loop, e para qualquer um que esteja pensando em como avaliar o comportamento agencial de longo prazo. Nenhuma preparação necessária — venha ler e discutir conosco. Jason Carver apresentará o artigo esta semana O que é o Clube de Leitura de Artigos do Learning Layer Labs? Uma iniciativa do https://www.learninglayer.ai, um laboratório com o objetivo de reduzir a ansiedade com IA no mundo. Qual é o formato? Baseado em discussão. Espere um ambiente de baixa pressão para compartilhar percepções e opiniões com o grupo. Quais são os objetivos do grupo? Manter-se atualizado sobre pesquisas em IA e melhorar a compreensão dos fundamentos de IA + matemática. Quem é bem-vindo? Todos! Tente dedicar pelo menos algum tempo ao artigo e venha preparado com perguntas ou coisas que gostaria de discutir, mas está tudo bem só aparecer! Equipe do Learning Layer Labs:

Localização do evento

Diga à sua rede que vai participar

Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.

Eventos relacionados

Stop Building AI Agents – Start Building AI SKILLS. A Complete TutorialWed, Jul 1 · 5:30 PM EDTby Tampa Bay Biotechicon 5.

Stop Building AI Agents – Start Building AI SKILLS. A Complete TutorialWed, Jul 1 · 5:30 PM EDTby Tampa Bay Biotechicon 5.

Tampa, United StatesWednesday, Jul 1 · 5:30 PM to 7:30 PM GMT-0400
UX-Ai Collab: meetup

UX-Ai Collab: meetup

Atlanta, United StatesMonday, Jun 29 · 6:30 PM to 8:30 PM GMT-0400
Community Round Table: AI, Agents, Skills and MCP | DenverScript June 2026

Community Round Table: AI, Agents, Skills and MCP | DenverScript June 2026

Denver, United StatesTuesday, Jun 23 · 6:00 PM to 8:00 PM GMT-0600
AI Meetup (July): GenAI LLMs and Agents

AI Meetup (July): GenAI LLMs and Agents

New York, United StatesThursday, Jul 9 · 5:30 PM to 8:30 PM GMT-0400
Streaming/ Tribe #26 - Le startup possono diventare autonome grazie all’AI?

Streaming/ Tribe #26 - Le startup possono diventare autonome grazie all’AI?

Torino, United States
Building an AI-Enabled BusinessTue, Jun 23 · 5:30 PM EDTby Entrepreneurs Learning & Growth Hubicon 4.

Building an AI-Enabled BusinessTue, Jun 23 · 5:30 PM EDTby Entrepreneurs Learning & Growth Hubicon 4.

Tampa, United StatesTuesday, Jun 23 · 5:30 PM to 7:30 PM GMT-0400
Summer AI Study Group Series Kick Off

Summer AI Study Group Series Kick Off

Tampa, United StatesThursday, Jul 23 · 5:30 PM to 7:00 PM GMT-0400
Ai Engineering primer

Ai Engineering primer

Lehi, United StatesTuesday, Jun 23 · 6:30 PM to 8:30 PM GMT-0600
7 seats leftAI Happy HourTue, Jun 23 · 7:00 PM EDTby AI Club3 attendees

7 seats leftAI Happy HourTue, Jun 23 · 7:00 PM EDTby AI Club3 attendees

Charlotte, United StatesTuesday, Jun 23 · 7:00 PM to 9:00 PM GMT-0400
The AI Underground - Conference

The AI Underground - Conference

Atlanta, United StatesSaturday, Aug 15 · 9:00 AM to 5:00 PM GMT-0400
AI think tank. Learn to make money with AI

AI think tank. Learn to make money with AI

Plant City, United StatesSunday, Jun 21 · 6:00 PM to 8:00 PM GMT-0400
7 seats leftSummer AI Study Group Series Kick OffThu, Jul 9 · 5:30 PM EDTby AI Study Group for Accounting & Finance3 attendees

7 seats leftSummer AI Study Group Series Kick OffThu, Jul 9 · 5:30 PM EDTby AI Study Group for Accounting & Finance3 attendees

Tampa, United StatesThursday, Jul 9 · 5:30 PM to 7:00 PM GMT-0400

Plataforma de inteligência artificial

Gratuito