
Clube de Leitura de Artigos do Learning Layer - Semana 33 - SlopCodeBench
Descrição
O artigo desta semana:SlopCodeBench: Avaliando como Agentes de Código se Degradam ao Longo de Tarefas Iterativas de Longo Prazo Link: https://arxiv.org/abs/2603.24755Site: https://www.scbench.ai/Código: https://github.com/SprocketLab/slop-code-bench Resumo: Quase todos os benchmarks de codificação pedem a um agente que resolva um problema uma vez, do zero. O software real não é construído dessa maneira — ele é estendido, repetidamente, por alguém que trabalha em cima de um código que já existe. Uma configuração de um único teste oculta a coisa com que os praticantes realmente se preocupam: não se um agente pode passar um teste hoje, mas como é o seu código após vinte rodadas de "agora também gerencie isso." O SlopCodeBench mede isso. É um benchmark de 36 problemas e 196 checkpoints nos quais um agente estende repetidamente sua própria solução anterior à medida que novos requisitos surgem. As especificações descrevem deliberadamente apenas o comportamento externo — um contrato de CLI ou API — e não dizem nada sobre arquitetura, assinaturas de funções ou limites de módulo, assim as decisões de design inicial são próprias do agente e se acumulam ao longo da execução. A suíte de testes permanece oculta para que não possa vazar dicas estruturais. Juntamente com a correção, os autores monitoram duas formas de degradação: erosão estrutural (complexidade concentrando em funções já complexas) e verbosidade (crescimento de código redundante e duplicado). Os resultados são sombrios. Ao longo de 15 agentes de codificação abertos e fechados, nenhum resolve completamente um único problema de ponta a ponta, e o melhor passa 14,8% dos checkpoints. A qualidade cai à medida que as trajetórias se alongam: a erosão estrutural aumenta em 77% das execuções e a verbosidade em 75,5%. A comparação que dá nome ao artigo: medido em relação a 473 repositórios Python de código aberto, o código do agente é 2,3x mais verboso e 2,0x mais erodido, e os repositórios humanos se degradam com menos frequência e por margens menores em suas histórias do git. Dizer explicitamente ao agente para escrever código limpo reduz a verbosidade e erosão iniciais em até um terço — mas não muda a taxa de degradação. Relevante para qualquer um que entregue código com um agente no loop, e para qualquer um que esteja pensando em como avaliar o comportamento agencial de longo prazo. Nenhuma preparação necessária — venha ler e discutir conosco. Jason Carver apresentará o artigo esta semana O que é o Clube de Leitura de Artigos do Learning Layer Labs? Uma iniciativa do https://www.learninglayer.ai, um laboratório com o objetivo de reduzir a ansiedade com IA no mundo. Qual é o formato? Baseado em discussão. Espere um ambiente de baixa pressão para compartilhar percepções e opiniões com o grupo. Quais são os objetivos do grupo? Manter-se atualizado sobre pesquisas em IA e melhorar a compreensão dos fundamentos de IA + matemática. Quem é bem-vindo? Todos! Tente dedicar pelo menos algum tempo ao artigo e venha preparado com perguntas ou coisas que gostaria de discutir, mas está tudo bem só aparecer! Equipe do Learning Layer Labs:
Localização do evento
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.
