
Клуб чтения научных статей Learning Layer - Неделя 33 - SlopCodeBench
Описание
Статья этой недели:SlopCodeBench: Оценка того, как агенты программирования деградируют в длинных итеративных задачах Ссылка: https://arxiv.org/abs/2603.24755Сайт: https://www.scbench.ai/Код: https://github.com/SprocketLab/slop-code-bench Аннотация: Почти любой кодовый бенчмарк просит агента решить проблему один раз, с нуля. Реальное программное обеспечение не создается таким образом — оно непрерывно расширяется человеком, работающим на основе уже существующего кода. Одноразовая настройка скрывает то, о чем на самом деле беспокоятся практики: не может ли агент пройти тест сегодня, а как будет выглядеть его код после двадцати раундов «теперь еще и это». SlopCodeBench измеряет это. Это бенчмарк из 36 задач и 196 контрольных точек, в которых агент неоднократно расширяет свое предыдущее решение по мере появления новых требований. Спецификации целенаправленно описывают только внешнее поведение — контракт CLI или API — и не говорят ничего о архитектуре, сигнатурах функций или границах модулей, так что ранние дизайнерские решения являются собственными решениями агента и накапливаются на протяжении всего запуска. Набор тестов остается скрытым, чтобы не раскрывать структурные подсказки. Помимо правильности, авторы отслеживают две формы деградации: структурная эрозия (сложность, сосредоточенная в уже сложных функциях) и многословие (увеличение дублирующегося, избыточного кода). Результаты мрачны. Среди 15 открытых и закрытых агентов программирования ни один не решает единственную проблему от начала до конца, а лучший проходит 14,8% контрольных точек. Качество падает с удлинением траекторий: структурная эрозия увеличивается в 77% запусков, а многословие — в 75,5%. Сравнение, которое дало название статье: по сравнению с 473 открытыми репозиториями Python, код агента в 2,3 раза более многословен и в 2,0 раза более эрозионен, а человеческие репозитории деградируют реже и на меньшие величины на протяжении своей истории git. Явное указание агенту писать чистый код снижает первоначальное многословие и эрозию до трети — но не влияет на скорость распада. Актуально для всех, кто отправляет код с агентом в процессе, и для всех, кто задумывается о том, как оценивать долгосрочное поведение агентов. Подготовка не требуется — приходите читать и обсуждать с нами. Джейсон Карвер будет представлять эту статью на этой неделе. Что такое Клуб чтения научных статей Learning Layer Labs? Инициатива от https://www.learninglayer.ai, лаборатории с целью снижения тревожности по поводу ИИ в мире. Каков формат? На основе обсуждений. Ожидайте непринужденную обстановку для обмена мнениями и взглядами с группой. Каковы цели группы? Следить за исследованиями ИИ и углублять понимание основ ИИ + математики. Кто может участвовать? Все! Постарайтесь уделить хотя бы немного времени на прочтение статьи и приходите подготовленными с вопросами или теми вещами, которые вы хотели бы обсудить, но можно просто прийти! Команда Learning Layer Labs:
Место проведения
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.
