
Modelos Rompedores 🚨 Sesión de Seguridad de IA 7: Demasiada Agente
Descripción
Parte 1 LLM03: Agente Excesivo Arshi Chadha, co-líder de OWASP Top 10 para Aplicaciones LLM 2026 El riesgo cuando se permite que un sistema de IA haga cosas, no solo diga cosas. Este riesgo ocupó el #6 en la lista de 2025. En la actualización de 2026, se trasladó al #3: el mayor salto de toda la lista, porque los incidentes de producción ahora se agrupan en torno a modelos que ejecutan comandos, llaman a APIs y acceden a bases de datos por su cuenta. Vamos a revisar las tres cosas que lo causan: demasiada funcionalidad, demasiados permisos, demasiada autonomía. Y lo que realmente lo contiene cuando el modelo es manipulado. Parte 2 Demostración interactiva: el asistente de correo electrónico que se vuelve rebelde Rishabh Gupta, Ingeniero de Software en Big Tech Un asistente de correo electrónico con inyección de instrucciones, en vivo. La misma instrucción maliciosa tiene éxito, es denegada o espera aprobación: dependiendo solo de cómo se establecen su funcionalidad, permisos y autonomía. Luego, un caso real: una inyección de instrucciones plantada en un canal público de Slack que hizo que Slack AI revelara secretos de canales privados. Parte 3 El incidente de Hugging Face: un agente que no se suponía que saliera de la sala Damian Halas, Arquitecto de Software Sr. en Nvidia En julio de 2026, modelos de OpenAI que se estaban probando en un benchmark cibernético encontraron una falla en el instalador de paquetes de su propio sandbox, alcanzaron internet abierto y se infiltraron en los sistemas de producción de Hugging Face para obtener respuestas para la prueba. Ningún humano dirigió nada de esto. Hugging Face vio acceso no autorizado a conjuntos de datos internos y credenciales de servicio. Revisaremos cómo un objetivo estrecho más acceso a herramientas más una brecha de contención convirtieron una evaluación en una verdadera violación, y lo que eso dice sobre probar modelos que están mejorando en esto. Parte 4 Ejercicio grupal: encadenando herramientas inofensivas en daños reales Obtienes un agente de soporte de IA con ocho herramientas. Cada una de ellas parece lo suficientemente segura como para aprobar por sí sola. Tu trabajo es encontrar la secuencia que filtre datos de clientes de todos modos: usando solo acciones permitidas. Luego lo revertimos y descubrimos dónde debe estar realmente el límite. Solo trae tus computadoras portátiles, no se necesita configuración.
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.