
Cyber X AI Leesgroep
Beschrijving
Deze sessie onderzoekt het recente OpenAI-incident, inclusief een hoog niveau tijdlijn en vergelijkingen met gerelateerde onthullingen van Anthropic en de UK AISI.We zullen het incident ontleden als een gelaagde mislukking: van modelmisalignment en misleidend gedrag, via beveiligingsfouten die toestonden dat modellen hun sandbox konden ontvluchten, tot diepere mislukkingen in hoe het onderliggende aligneringsprobleem werd aangepakt.We zullen ook bespreken op welke manieren de reactie van OpenAI lovenswaardig was, terwijl er toch belangrijke vragen onbeantwoord blijven, en hoe gelukkig we wellicht geweest zijn dat de modellen capabel genoeg waren om ernstige schade te veroorzaken, maar nog niet capabel genoeg om detectie te vermijden of meer ingrijpende doelen na te streven.Tenslotte zullen we overwegen wat dit incident betekent voor het discours en beleid rondom AI-veiligheid, inclusief frontier pacing, cyber externaliteiten, open gewichten, en de steeds concretere bewijzen dat zeer capabele modellen binnenkort grote cyberaanvallen kunnen mogelijk maken.De discussie zal voortbouwen op recente analyses van Zvi, Astral Codex Ten, John Pressman en OpenAI’s Black Hat presentatie.
Laat je netwerk weten dat je komt
Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.