
Learning Layer Paper Reading Club - Week 33 - SlopCodeBench
Опис
Папер цього тижня:SlopCodeBench: Бенчмаркінг того, як кодувальні агенти деградують у довгострокових ітеративних завданнях Посилання: https://arxiv.org/abs/2603.24755Сайт: https://www.scbench.ai/Код: https://github.com/SprocketLab/slop-code-bench Анотація: Практично кожен кодувальний бенчмарк просить агента вирішити проблему один раз, з нуля. Реальне програмне забезпечення не створюється таким чином — воно розширюється знову і знову людиною, яка працює над уже існуючим кодом. Налаштування в один клік приховує те, на що практики дійсно звертають увагу: чи може агент пройти тест сьогодні, а що його код виглядає після двадцяти раундів «теперь також з цим справлятися». SlopCodeBench це вимірює. Це бенчмарк з 36 проблемами та 196 контрольними точками, в яких агент неодноразово вдосконалює своє попереднє рішення, оскільки з’являються нові вимоги. Специфікації навмисно описують лише зовнішню поведінку — контракт CLI або API — і нічого не говорять про архітектуру, підписи функцій чи межі модулів, тому перші дизайнерські рішення залишаються за агентом і накопичуються протягом роботи. Тестовий набір залишається прихованим, тому не може надавати структурні підказки. На тлі правильності автори слідкують за двома формами деградації: структурна ерозія (складність зосереджується в уже складних функціях) та надмірність (зростання надмірного, дубльованого коду). Результати сумні. Серед 15 відкритих і закритих кодувальних агентів жоден повністю не вирішує жодну проблему до кінця, а найкращий проходить 14.8% контрольних точок. Якість знижується, коли траєкторії подовжуються: структурна ерозія зростає у 77% запусків, а надмірність - у 75.5%. Порівняння, яке дало назву статті: в порівнянні з 473 відкритими репозиторіями Python, код агента є на 2.3 рази більш надмірним і на 2.0 рази більш еродованим, і людські репозиторії деградують рідше і на менші відстані протягом їх гіт-історій. Явно кажучи агенту, щоб писати чистий код, зменшує початкову надмірність та ерозію до третини — але нічого не робить для швидкості розпаду. Актуально для всіх, хто постачає код з агентом у процесі, і для всіх, хто думає про те, як оцінити довгострокову агентську поведінку. Підготовка не потрібна — приходьте читати та обговорювати це з нами. Джейсон Карвер представлятиме статтю цього тижня Що таке Клуб читання паперів Learning Layer Labs? Ініціатива https://www.learninglayer.ai, лабораторії з метою зменшення тривоги щодо ШІ у світі. Який формат? На основі обговорення. Очікуйте низький тиск для обміну поглядами та думками з групою. Які цілі групи? Слідувати новинам досліджень у галузі ШІ та покращувати розуміння основ ШІ + математики. Хто може приєднатися? Всі! Спробуйте витратити принаймні трохи часу на статтю та приходьте з підготовленими запитаннями або речами, які ви хотіли б обговорити, але також прийнятно просто прийти! Команда Learning Layer Labs:
Місце проведення
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.
