Evenement toevoegen
Leerlaag Paper Leeskamer - Week 33 - SlopCodeBench

Leerlaag Paper Leeskamer - Week 33 - SlopCodeBench

22 sep. 202617:30 - 19:30 America/Los_AngelesSan Francisco, United States20 DeelnemersOpen

Beschrijving

Dit week's paper:SlopCodeBench: Benchmarking Hoe Codering Agenten Achteruitgaan Over Lange Horizon Iteratieve Taken Link: https://arxiv.org/abs/2603.24755Site: https://www.scbench.ai/Code: https://github.com/SprocketLab/slop-code-bench Samenvatting: Bijna elke code benchmark vraagt een agent om een probleem één keer op te lossen, vanaf nul. Echte software wordt zo niet gebouwd — het wordt telkens opnieuw uitgebreid door iemand die werkt bovenop de bestaande code. Een eenmalige opstelling verbergt waar praktijken zich daadwerkelijk zorgen over maken: niet of een agent vandaag een test kan doorstaan, maar hoe zijn code eruitziet na twintig rondes van "verwerk dit nu ook." SlopCodeBench meet dat. Het is een benchmark van 36 problemen en 196 checkpoints waarin een agent herhaaldelijk zijn eigen eerdere oplossing uitbreidt naarmate er nieuwe eisen binnenkomen. De specificaties beschrijven opzettelijk alleen extern gedrag — een CLI of API-contract — en zeggen niets over architectuur, functietekens of modulegrenzen, zodat vroege ontwerpbeslissingen de eigen keuzes van de agent zijn en zich opstapelen gedurende de run. De test suite blijft verborgen zodat het geen structurele aanwijzingen kan lekken. Naast correctheid volgen de auteurs twee vormen van degradatie: structurele erosie (complexiteit die zich concentreert in al complexe functies) en verbosity (groei van redundante, gedupliceerde code). De resultaten zijn somber. Van 15 open en gesloten coderingsagenten lost geen enkele volledig een enkel probleem van begin tot eind op, en de beste slaagt in 14.8% van de checkpoints. De kwaliteit neemt af naarmate de trajecten langer worden: structurele erosie stijgt in 77% van de runs en verbosity in 75.5%. De vergelijking die de paper zijn naam geeft: vergeleken met 473 open-source Python-repositories is de code van de agent 2.3x meer verbose en 2.0x meer geërodeerd, en de menselijke repos degraderen minder vaak en met kleinere marges in hun git-historie. Het expliciet vertellen aan de agent om schone code te schrijven vermindert de initiële verbosity en erosie met tot een derde — maar verandert niets aan de vervalratio. Relevant voor iedereen die code levert met een agent in de lus, en voor iedereen die nadenkt over hoe de agentic gedrag over lange horizon te evalueren. Geen voorbereiding vereist — kom lezen en bespreken met ons. Jason Carver zal deze week de paper presenteren Wat is de Leerlaag Labs Paper Leeskamer? Een initiatief van https://www.learninglayer.ai, een lab met als doel de AI-angst in de wereld te verminderen. Wat is het formaat? Discussie-gebaseerd. Verwacht een laagdrempelige omgeving om inzichten en meningen met de groep te delen. Wat zijn de groepsdoelen? Op de hoogte blijven van AI-onderzoek en het begrip van AI-fundamenten + wiskunde verbeteren. Wie is welkom? Iedereen! Probeer minstens enige tijd aan de paper te besteden en kom voorbereid met vragen of dingen die je zou willen bespreken, maar het is oké om gewoon op te dagen! Leerlaag Labs team:

Locatie evenement

Laat je netwerk weten dat je komt

Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.

Gerelateerde evenementen

Stop Building AI Agents – Start Building AI SKILLS. A Complete TutorialWed, Jul 1 · 5:30 PM EDTby Tampa Bay Biotechicon 5.

Stop Building AI Agents – Start Building AI SKILLS. A Complete TutorialWed, Jul 1 · 5:30 PM EDTby Tampa Bay Biotechicon 5.

Tampa, United StatesWednesday, Jul 1 · 5:30 PM to 7:30 PM GMT-0400
UX-Ai Collab: meetup

UX-Ai Collab: meetup

Atlanta, United StatesMonday, Jun 29 · 6:30 PM to 8:30 PM GMT-0400
Community Round Table: AI, Agents, Skills and MCP | DenverScript June 2026

Community Round Table: AI, Agents, Skills and MCP | DenverScript June 2026

Denver, United StatesTuesday, Jun 23 · 6:00 PM to 8:00 PM GMT-0600
AI Meetup (July): GenAI LLMs and Agents

AI Meetup (July): GenAI LLMs and Agents

New York, United StatesThursday, Jul 9 · 5:30 PM to 8:30 PM GMT-0400
Streaming/ Tribe #26 - Le startup possono diventare autonome grazie all’AI?

Streaming/ Tribe #26 - Le startup possono diventare autonome grazie all’AI?

Torino, United States
Building an AI-Enabled BusinessTue, Jun 23 · 5:30 PM EDTby Entrepreneurs Learning & Growth Hubicon 4.

Building an AI-Enabled BusinessTue, Jun 23 · 5:30 PM EDTby Entrepreneurs Learning & Growth Hubicon 4.

Tampa, United StatesTuesday, Jun 23 · 5:30 PM to 7:30 PM GMT-0400
Summer AI Study Group Series Kick Off

Summer AI Study Group Series Kick Off

Tampa, United StatesThursday, Jul 23 · 5:30 PM to 7:00 PM GMT-0400
Ai Engineering primer

Ai Engineering primer

Lehi, United StatesTuesday, Jun 23 · 6:30 PM to 8:30 PM GMT-0600
7 seats leftAI Happy HourTue, Jun 23 · 7:00 PM EDTby AI Club3 attendees

7 seats leftAI Happy HourTue, Jun 23 · 7:00 PM EDTby AI Club3 attendees

Charlotte, United StatesTuesday, Jun 23 · 7:00 PM to 9:00 PM GMT-0400
The AI Underground - Conference

The AI Underground - Conference

Atlanta, United StatesSaturday, Aug 15 · 9:00 AM to 5:00 PM GMT-0400
AI think tank. Learn to make money with AI

AI think tank. Learn to make money with AI

Plant City, United StatesSunday, Jun 21 · 6:00 PM to 8:00 PM GMT-0400
7 seats leftSummer AI Study Group Series Kick OffThu, Jul 9 · 5:30 PM EDTby AI Study Group for Accounting & Finance3 attendees

7 seats leftSummer AI Study Group Series Kick OffThu, Jul 9 · 5:30 PM EDTby AI Study Group for Accounting & Finance3 attendees

Tampa, United StatesThursday, Jul 9 · 5:30 PM to 7:00 PM GMT-0400

Platform voor kunstmatige intelligentie

Gratis