
Leerlaag Paper Leeskamer - Week 33 - SlopCodeBench
Beschrijving
Dit week's paper:SlopCodeBench: Benchmarking Hoe Codering Agenten Achteruitgaan Over Lange Horizon Iteratieve Taken Link: https://arxiv.org/abs/2603.24755Site: https://www.scbench.ai/Code: https://github.com/SprocketLab/slop-code-bench Samenvatting: Bijna elke code benchmark vraagt een agent om een probleem één keer op te lossen, vanaf nul. Echte software wordt zo niet gebouwd — het wordt telkens opnieuw uitgebreid door iemand die werkt bovenop de bestaande code. Een eenmalige opstelling verbergt waar praktijken zich daadwerkelijk zorgen over maken: niet of een agent vandaag een test kan doorstaan, maar hoe zijn code eruitziet na twintig rondes van "verwerk dit nu ook." SlopCodeBench meet dat. Het is een benchmark van 36 problemen en 196 checkpoints waarin een agent herhaaldelijk zijn eigen eerdere oplossing uitbreidt naarmate er nieuwe eisen binnenkomen. De specificaties beschrijven opzettelijk alleen extern gedrag — een CLI of API-contract — en zeggen niets over architectuur, functietekens of modulegrenzen, zodat vroege ontwerpbeslissingen de eigen keuzes van de agent zijn en zich opstapelen gedurende de run. De test suite blijft verborgen zodat het geen structurele aanwijzingen kan lekken. Naast correctheid volgen de auteurs twee vormen van degradatie: structurele erosie (complexiteit die zich concentreert in al complexe functies) en verbosity (groei van redundante, gedupliceerde code). De resultaten zijn somber. Van 15 open en gesloten coderingsagenten lost geen enkele volledig een enkel probleem van begin tot eind op, en de beste slaagt in 14.8% van de checkpoints. De kwaliteit neemt af naarmate de trajecten langer worden: structurele erosie stijgt in 77% van de runs en verbosity in 75.5%. De vergelijking die de paper zijn naam geeft: vergeleken met 473 open-source Python-repositories is de code van de agent 2.3x meer verbose en 2.0x meer geërodeerd, en de menselijke repos degraderen minder vaak en met kleinere marges in hun git-historie. Het expliciet vertellen aan de agent om schone code te schrijven vermindert de initiële verbosity en erosie met tot een derde — maar verandert niets aan de vervalratio. Relevant voor iedereen die code levert met een agent in de lus, en voor iedereen die nadenkt over hoe de agentic gedrag over lange horizon te evalueren. Geen voorbereiding vereist — kom lezen en bespreken met ons. Jason Carver zal deze week de paper presenteren Wat is de Leerlaag Labs Paper Leeskamer? Een initiatief van https://www.learninglayer.ai, een lab met als doel de AI-angst in de wereld te verminderen. Wat is het formaat? Discussie-gebaseerd. Verwacht een laagdrempelige omgeving om inzichten en meningen met de groep te delen. Wat zijn de groepsdoelen? Op de hoogte blijven van AI-onderzoek en het begrip van AI-fundamenten + wiskunde verbeteren. Wie is welkom? Iedereen! Probeer minstens enige tijd aan de paper te besteden en kom voorbereid met vragen of dingen die je zou willen bespreken, maar het is oké om gewoon op te dagen! Leerlaag Labs team:
Locatie evenement
Laat je netwerk weten dat je komt
Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.
