Dodaj wydarzenie
Klub Czytania Prac Layer Learning - Tydzień 33 - SlopCodeBench

Klub Czytania Prac Layer Learning - Tydzień 33 - SlopCodeBench

22 wrz 202617:30 - 19:30 America/Los_AngelesSan Francisco, United States20 UczestnikówOpen

Opis

Praca na ten tydzień:SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks Link: https://arxiv.org/abs/2603.24755Strona: https://www.scbench.ai/Kod: https://github.com/SprocketLab/slop-code-bench Streszczenie: Prawie każdy benchmark programistyczny prosi agenta o rozwiązanie problemu raz, od podstaw. Prawdziwe oprogramowanie nie jest budowane w ten sposób — jest rozszerzane, wciąż na nowo, przez kogoś, kto pracuje na istniejącym już kodzie. Ustawienie jednoetapowe ukrywa to, co praktycy naprawdę martwi: nie to, czy agent może zdać test dzisiaj, ale jak wygląda jego kod po dwudziestu rundach domagania się "teraz obsłuż to także". SlopCodeBench to miara tego. Jest benchmarkiem 36 problemów i 196 punktów kontrolnych, w których agent wielokrotnie rozszerza swoje wcześniejsze rozwiązanie w miarę pojawiania się nowych wymagań. Specyfikacje celowo opisują tylko zachowanie zewnętrzne — umowę CLI lub API — i nic nie mówią o architekturze, sygnaturach funkcji czy granicach modułów, więc wczesne decyzje projektowe są w gestii agenta i kumulują się w trakcie działania. Zestaw testów pozostaje ukryty, aby nie ujawniać wskazówek strukturalnych. Obok poprawności, autorzy śledzą dwie formy degradacji: erozję strukturalną (złożoność koncentrująca się w już złożonych funkcjach) oraz obszerność (wzrost redundantnego, powielonego kodu). Wyniki są ponure. Wśród 15 otwartych i zamkniętych agentów programistycznych, żaden nie rozwiązuje w pełni pojedynczego problemu od początku do końca, a najlepszy zdaje 14,8% punktów kontrolnych. Jakość spada w miarę wydłużania się trajektorii: erozja strukturalna rośnie w 77% przypadków, a obszerność w 75,5%. Porównanie, które nadaje pracy jej nazwę: w porównaniu do 473 otwartych repozytoriów Pythona, kod agenta jest 2,3 razy bardziej obszerny i 2,0 razy bardziej erodowany, a repozytoria ludzi degradują rzadziej i w mniejszych marginesach w swoich historii git. Wyraźne zlecenie agentowi pisania czystego kodu redukuje początkową obszerność i erozję o jedną trzecią — ale nie wpływa na tempo degradacji. Istotne dla każdego, kto dostarcza kod z agentem w pętli, oraz dla każdego, kto zastanawia się, jak oceniać długoterminowe zachowanie agentów. Nie jest wymagana żadna przygotowanie — przyjdź, aby przeczytać i dyskutować z nami. Jason Carver przedstawi pracę w tym tygodniu. Czym jest Klub Czytania Prac Layer Learning? Inicjatywa od https://www.learninglayer.ai, laboratorium z celem zmniejszenia lęku przed AI w świecie. Jaki jest format? Skierowany na dyskusję. Oczekuj niskociśnieniowego środowiska, aby dzielić się spostrzeżeniami i opiniami z grupą. Jakie są cele grupy? By być na bieżąco z badaniami AI i poprawić zrozumienie podstaw AI + matematyki. Kto jest mile widziany? Każdy! Staraj się poświęcić przynajmniej trochę czasu na pracę i przyjść przygotowanym z pytaniami lub rzeczami, które chciałbyś omówić, ale możesz po prostu przyjść! Zespół Learning Layer Labs:

Lokalizacja wydarzenia

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Powiązane wydarzenia

Stop Building AI Agents – Start Building AI SKILLS. A Complete TutorialWed, Jul 1 · 5:30 PM EDTby Tampa Bay Biotechicon 5.

Stop Building AI Agents – Start Building AI SKILLS. A Complete TutorialWed, Jul 1 · 5:30 PM EDTby Tampa Bay Biotechicon 5.

Tampa, United StatesWednesday, Jul 1 · 5:30 PM to 7:30 PM GMT-0400
UX-Ai Collab: meetup

UX-Ai Collab: meetup

Atlanta, United StatesMonday, Jun 29 · 6:30 PM to 8:30 PM GMT-0400
Community Round Table: AI, Agents, Skills and MCP | DenverScript June 2026

Community Round Table: AI, Agents, Skills and MCP | DenverScript June 2026

Denver, United StatesTuesday, Jun 23 · 6:00 PM to 8:00 PM GMT-0600
AI Meetup (July): GenAI LLMs and Agents

AI Meetup (July): GenAI LLMs and Agents

New York, United StatesThursday, Jul 9 · 5:30 PM to 8:30 PM GMT-0400
Streaming/ Tribe #26 - Le startup possono diventare autonome grazie all’AI?

Streaming/ Tribe #26 - Le startup possono diventare autonome grazie all’AI?

Torino, United States
Building an AI-Enabled BusinessTue, Jun 23 · 5:30 PM EDTby Entrepreneurs Learning & Growth Hubicon 4.

Building an AI-Enabled BusinessTue, Jun 23 · 5:30 PM EDTby Entrepreneurs Learning & Growth Hubicon 4.

Tampa, United StatesTuesday, Jun 23 · 5:30 PM to 7:30 PM GMT-0400
Summer AI Study Group Series Kick Off

Summer AI Study Group Series Kick Off

Tampa, United StatesThursday, Jul 23 · 5:30 PM to 7:00 PM GMT-0400
Ai Engineering primer

Ai Engineering primer

Lehi, United StatesTuesday, Jun 23 · 6:30 PM to 8:30 PM GMT-0600
7 seats leftAI Happy HourTue, Jun 23 · 7:00 PM EDTby AI Club3 attendees

7 seats leftAI Happy HourTue, Jun 23 · 7:00 PM EDTby AI Club3 attendees

Charlotte, United StatesTuesday, Jun 23 · 7:00 PM to 9:00 PM GMT-0400
The AI Underground - Conference

The AI Underground - Conference

Atlanta, United StatesSaturday, Aug 15 · 9:00 AM to 5:00 PM GMT-0400
AI think tank. Learn to make money with AI

AI think tank. Learn to make money with AI

Plant City, United StatesSunday, Jun 21 · 6:00 PM to 8:00 PM GMT-0400
7 seats leftSummer AI Study Group Series Kick OffThu, Jul 9 · 5:30 PM EDTby AI Study Group for Accounting & Finance3 attendees

7 seats leftSummer AI Study Group Series Kick OffThu, Jul 9 · 5:30 PM EDTby AI Study Group for Accounting & Finance3 attendees

Tampa, United StatesThursday, Jul 9 · 5:30 PM to 7:00 PM GMT-0400

Platforma sztucznej inteligencji

Bezpłatnie