
Klub Czytania Prac Layer Learning - Tydzień 33 - SlopCodeBench
Opis
Praca na ten tydzień:SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks Link: https://arxiv.org/abs/2603.24755Strona: https://www.scbench.ai/Kod: https://github.com/SprocketLab/slop-code-bench Streszczenie: Prawie każdy benchmark programistyczny prosi agenta o rozwiązanie problemu raz, od podstaw. Prawdziwe oprogramowanie nie jest budowane w ten sposób — jest rozszerzane, wciąż na nowo, przez kogoś, kto pracuje na istniejącym już kodzie. Ustawienie jednoetapowe ukrywa to, co praktycy naprawdę martwi: nie to, czy agent może zdać test dzisiaj, ale jak wygląda jego kod po dwudziestu rundach domagania się "teraz obsłuż to także". SlopCodeBench to miara tego. Jest benchmarkiem 36 problemów i 196 punktów kontrolnych, w których agent wielokrotnie rozszerza swoje wcześniejsze rozwiązanie w miarę pojawiania się nowych wymagań. Specyfikacje celowo opisują tylko zachowanie zewnętrzne — umowę CLI lub API — i nic nie mówią o architekturze, sygnaturach funkcji czy granicach modułów, więc wczesne decyzje projektowe są w gestii agenta i kumulują się w trakcie działania. Zestaw testów pozostaje ukryty, aby nie ujawniać wskazówek strukturalnych. Obok poprawności, autorzy śledzą dwie formy degradacji: erozję strukturalną (złożoność koncentrująca się w już złożonych funkcjach) oraz obszerność (wzrost redundantnego, powielonego kodu). Wyniki są ponure. Wśród 15 otwartych i zamkniętych agentów programistycznych, żaden nie rozwiązuje w pełni pojedynczego problemu od początku do końca, a najlepszy zdaje 14,8% punktów kontrolnych. Jakość spada w miarę wydłużania się trajektorii: erozja strukturalna rośnie w 77% przypadków, a obszerność w 75,5%. Porównanie, które nadaje pracy jej nazwę: w porównaniu do 473 otwartych repozytoriów Pythona, kod agenta jest 2,3 razy bardziej obszerny i 2,0 razy bardziej erodowany, a repozytoria ludzi degradują rzadziej i w mniejszych marginesach w swoich historii git. Wyraźne zlecenie agentowi pisania czystego kodu redukuje początkową obszerność i erozję o jedną trzecią — ale nie wpływa na tempo degradacji. Istotne dla każdego, kto dostarcza kod z agentem w pętli, oraz dla każdego, kto zastanawia się, jak oceniać długoterminowe zachowanie agentów. Nie jest wymagana żadna przygotowanie — przyjdź, aby przeczytać i dyskutować z nami. Jason Carver przedstawi pracę w tym tygodniu. Czym jest Klub Czytania Prac Layer Learning? Inicjatywa od https://www.learninglayer.ai, laboratorium z celem zmniejszenia lęku przed AI w świecie. Jaki jest format? Skierowany na dyskusję. Oczekuj niskociśnieniowego środowiska, aby dzielić się spostrzeżeniami i opiniami z grupą. Jakie są cele grupy? By być na bieżąco z badaniami AI i poprawić zrozumienie podstaw AI + matematyki. Kto jest mile widziany? Każdy! Staraj się poświęcić przynajmniej trochę czasu na pracę i przyjść przygotowanym z pytaniami lub rzeczami, które chciałbyś omówić, ale możesz po prostu przyjść! Zespół Learning Layer Labs:
Lokalizacja wydarzenia
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.
