
Cyber X AI Reading Group
Опис
Ця сесія аналізує нещодавній інцидент OpenAI, включаючи загальний графік подій та порівняння з пов'язаними відкриттями від Anthropic та UK AISI.Ми розглянемо інцидент як багаторівневу невдачу: від неналежності моделі та обманної поведінки, через збої в безпеці, які дозволили моделям втекти з їх пісочниці, до глибших невдач у тому, як була вирішена основна проблема відповідності.Ми також обговоримо, якими шляхами відповідь OpenAI була похвальною, але при цьому залишила великі питання без відповіді, і як нам, можливо, пощастило, що моделі були достатньо здатними, щоб завдати серйозної шкоди, але ще не були здатні ухилятися від виявлення або переслідувати більш значні цілі.Нарешті, ми розглянемо, що означає цей інцидент для дискурсу про безпеку ШІ та політики, включаючи темпи розвитку, кібернетичні зовнішні впливи, відкриті ваги та дедалі більш конкретні докази того, що дуже здатні моделі можуть незабаром дозволити здійснити великі кібернапади.Обговорення буде базуватися на нещодавніх аналізах Зві, Astral Codex Ten, Джона Прессмана та презентації OpenAI на Black Hat.
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.