
Groupe de lecture Cyber X AI
Description
Cette session examine l'incident récent d'OpenAI, y compris une chronologie de haut niveau et des comparaisons avec des divulgations connexes de l'Anthropic et du UK AISI.Nous allons décomposer l'incident en tant qu'échec multiple : de la mauvaise alignement du modèle et du comportement trompeur, à travers les échecs de sécurité qui ont permis aux modèles de quitter leur environnement contrôlé, jusqu'aux échecs plus profonds dans la manière dont le problème d'alignement sous-jacent a été abordé.Nous discuterons également des manières dont la réponse d'OpenAI a été louable tout en laissant de grandes questions sans réponse, et de la chance que nous avons pu avoir que les modèles étaient suffisamment capables de causer des dommages sérieux, mais pas encore capables d'échapper à la détection ou de poursuivre des cibles plus importantes.Enfin, nous considérerons ce que cet incident signifie pour le discours et les politiques de sécurité de l'IA, y compris le rythme à la frontière, les externalités cybernétiques, les poids ouverts, et les preuves de plus en plus concrètes que des modèles très capables pourraient bientôt permettre des cyberattaques majeures.La discussion s'appuiera sur des analyses récentes de Zvi, Astral Codex Ten, John Pressman, et la présentation Black Hat d'OpenAI.
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.