Додати подію
Learning Layer Paper Reading Club - Week 33 - SlopCodeBench

Learning Layer Paper Reading Club - Week 33 - SlopCodeBench

22 вер 202617:30 - 19:30 America/Los_AngelesSan Francisco, United States20 УчасниківOpen

Опис

Папер цього тижня:SlopCodeBench: Бенчмаркінг того, як кодувальні агенти деградують у довгострокових ітеративних завданнях Посилання: https://arxiv.org/abs/2603.24755Сайт: https://www.scbench.ai/Код: https://github.com/SprocketLab/slop-code-bench Анотація: Практично кожен кодувальний бенчмарк просить агента вирішити проблему один раз, з нуля. Реальне програмне забезпечення не створюється таким чином — воно розширюється знову і знову людиною, яка працює над уже існуючим кодом. Налаштування в один клік приховує те, на що практики дійсно звертають увагу: чи може агент пройти тест сьогодні, а що його код виглядає після двадцяти раундів «теперь також з цим справлятися». SlopCodeBench це вимірює. Це бенчмарк з 36 проблемами та 196 контрольними точками, в яких агент неодноразово вдосконалює своє попереднє рішення, оскільки з’являються нові вимоги. Специфікації навмисно описують лише зовнішню поведінку — контракт CLI або API — і нічого не говорять про архітектуру, підписи функцій чи межі модулів, тому перші дизайнерські рішення залишаються за агентом і накопичуються протягом роботи. Тестовий набір залишається прихованим, тому не може надавати структурні підказки. На тлі правильності автори слідкують за двома формами деградації: структурна ерозія (складність зосереджується в уже складних функціях) та надмірність (зростання надмірного, дубльованого коду). Результати сумні. Серед 15 відкритих і закритих кодувальних агентів жоден повністю не вирішує жодну проблему до кінця, а найкращий проходить 14.8% контрольних точок. Якість знижується, коли траєкторії подовжуються: структурна ерозія зростає у 77% запусків, а надмірність - у 75.5%. Порівняння, яке дало назву статті: в порівнянні з 473 відкритими репозиторіями Python, код агента є на 2.3 рази більш надмірним і на 2.0 рази більш еродованим, і людські репозиторії деградують рідше і на менші відстані протягом їх гіт-історій. Явно кажучи агенту, щоб писати чистий код, зменшує початкову надмірність та ерозію до третини — але нічого не робить для швидкості розпаду. Актуально для всіх, хто постачає код з агентом у процесі, і для всіх, хто думає про те, як оцінити довгострокову агентську поведінку. Підготовка не потрібна — приходьте читати та обговорювати це з нами. Джейсон Карвер представлятиме статтю цього тижня Що таке Клуб читання паперів Learning Layer Labs? Ініціатива https://www.learninglayer.ai, лабораторії з метою зменшення тривоги щодо ШІ у світі. Який формат? На основі обговорення. Очікуйте низький тиск для обміну поглядами та думками з групою. Які цілі групи? Слідувати новинам досліджень у галузі ШІ та покращувати розуміння основ ШІ + математики. Хто може приєднатися? Всі! Спробуйте витратити принаймні трохи часу на статтю та приходьте з підготовленими запитаннями або речами, які ви хотіли б обговорити, але також прийнятно просто прийти! Команда Learning Layer Labs:

Місце проведення

Розкажіть своїй мережі, що ви йдете

Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.

Подібні події

Припиніть створювати AI-агентів – почніть створювати AI-НАВИЧКИ. Повний посібник. Середа, 1 липня · 5:30 вечора за східним часом США від Tampa Bay Biotechicon 5.

Припиніть створювати AI-агентів – почніть створювати AI-НАВИЧКИ. Повний посібник. Середа, 1 липня · 5:30 вечора за східним часом США від Tampa Bay Biotechicon 5.

Tampa, United StatesWednesday, Jul 1 · 5:30 PM to 7:30 PM GMT-0400
Зустріч UX-Ai Співпраця

Зустріч UX-Ai Співпраця

Atlanta, United StatesMonday, Jun 29 · 6:30 PM to 8:30 PM GMT-0400
Зустріч за круглим столом: ШІ, агенти, навички та MCP | DenverScript червень 2026

Зустріч за круглим столом: ШІ, агенти, навички та MCP | DenverScript червень 2026

Denver, United StatesTuesday, Jun 23 · 6:00 PM to 8:00 PM GMT-0600
Зустріч AI (липень): GenAI LLMs та агенти

Зустріч AI (липень): GenAI LLMs та агенти

New York, United StatesThursday, Jul 9 · 5:30 PM to 8:30 PM GMT-0400
Стримінг/ Tribe #26 - Чи можуть стартапи стати автономними завдяки штучному інтелекту?

Стримінг/ Tribe #26 - Чи можуть стартапи стати автономними завдяки штучному інтелекту?

Torino, United States
Створення бізнесу з використанням ІІ Вівторок, 23 червня · 17:30 EDT організовано Підприємцями Навчання та Зростання Хабікон 4.

Створення бізнесу з використанням ІІ Вівторок, 23 червня · 17:30 EDT організовано Підприємцями Навчання та Зростання Хабікон 4.

Tampa, United StatesTuesday, Jun 23 · 5:30 PM to 7:30 PM GMT-0400
Початок серії літніх групових занять з вивчення штучного інтелекту

Початок серії літніх групових занять з вивчення штучного інтелекту

Tampa, United StatesThursday, Jul 23 · 5:30 PM to 7:00 PM GMT-0400
Основи AI інженерії

Основи AI інженерії

Lehi, United StatesTuesday, Jun 23 · 6:30 PM to 8:30 PM GMT-0600
Залишилося 7 місць Щаслива година штучного інтелекту Вівторок, 23 червня · 19:00 EDT організовано AI Club 3 учасники

Залишилося 7 місць Щаслива година штучного інтелекту Вівторок, 23 червня · 19:00 EDT організовано AI Club 3 учасники

Charlotte, United StatesTuesday, Jun 23 · 7:00 PM to 9:00 PM GMT-0400
Конференція «Підпільний штучний інтелект»

Конференція «Підпільний штучний інтелект»

Atlanta, United StatesSaturday, Aug 15 · 9:00 AM to 5:00 PM GMT-0400
AI аналітичний центр. Вчіться заробляти за допомогою AI.

AI аналітичний центр. Вчіться заробляти за допомогою AI.

Plant City, United StatesSunday, Jun 21 · 6:00 PM to 8:00 PM GMT-0400
Залишилося 7 місцьЛітня серія групових занять з штучного інтелекту: стартЧетвер, 9 липня · 17:30 EDTвід Групи з вивчення штучного інтелекту для бухгалтерії та фінансів3 учасники

Залишилося 7 місцьЛітня серія групових занять з штучного інтелекту: стартЧетвер, 9 липня · 17:30 EDTвід Групи з вивчення штучного інтелекту для бухгалтерії та фінансів3 учасники

Tampa, United StatesThursday, Jul 9 · 5:30 PM to 7:00 PM GMT-0400

Платформа штучного інтелекту

Безкоштовно