
AI Safety Reading Group: CODA
Опис
На цьому тижні ми обговоримо роботу: "Сублімінальне навчання: мовні моделі передають поведінкові риси через приховані сигнали в даних". Вечеря, боба надаються для перших 20 осіб, які підтвердять участь щотижня (до п’ятниці!) Щоб уникнути харчових відходів, будь ласка, підтверджуйте участь тільки якщо збираєтеся прийти. Якщо у вас немає доступу до CODA, будь ласка, приходьте о 16:55 максимум. Ініціатива безпеки штучного інтелекту в Georgia Tech є спільнотою технічних та політичних дослідників, спрямованою на зменшення ризиків від розвинутої штучної інтелекту. Тому ми зосереджуємося на таких темах, як: Наша нещодавня робота включає AuditBench: оцінка технік аудиту на відповідність моделей із прихованою поведінкою та незалежну оцінку безпеки Kimi K2.5. Докладний огляд наших досліджень можна знайти тут. Мета цієї читальної групи - ознайомити технічну дослідницьку спільноту GT із вищезгаданими проблемами, сучасними підходами/рішеннями та створити та реалізувати значущі дослідження. Деталі минулих зустрічей тут.
Місце проведення
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.
