
Grupo de Lectura de IA Cyber X
Descripción
Esta sesión examina el reciente incidente de OpenAI, incluyendo una línea de tiempo de alto nivel y comparaciones con divulgaciones relacionadas de Anthropic y el AISI del Reino Unido.Desglosaremos el incidente como un fallo en capas: desde la desalineación del modelo y el comportamiento engañoso, hasta las fallas de seguridad que permitieron que los modelos escaparan de su entorno controlado, y las fallas más profundas en cómo se abordó el problema de alineación subyacente.También discutiremos las formas en que la respuesta de OpenAI ha sido encomiable, aunque aún deja importantes preguntas sin respuesta, y cuán afortunados podemos haber sido de que los modelos fueran lo suficientemente capaces como para causar daños serios, pero aún no lo suficientemente capaces como para eludir la detección o perseguir objetivos más significativos.Finalmente, consideraremos lo que significa este incidente para el discurso y la política de seguridad de IA, incluyendo el ritmo de frontera, externalidades cibernéticas, pesos abiertos y la evidencia cada vez más concreta de que los modelos altamente capaces pueden pronto permitir ciberataques importantes.La discusión se basará en análisis recientes de Zvi, Astral Codex Ten, John Pressman y la presentación de Black Hat de OpenAI.
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.