
Modelos de Seguridad de IA en Ruptura
Descripción
Dos charlas esta semana. Una cierra un círculo, la otra abre un agujero de conejo. Parte 1 — Defensas contra la Inyección de Prompts: Qué Funciona, Qué es Teatro (Arshi Chadha, Ingeniero de Ciberseguridad Senior, Zscaler, 20 min) Última sesión: 11 clases de ataques, CVEs. Esta sesión: el lado de la defensa. ¿Qué mitigaciones realmente se sostienen, cuáles solo parecen seguras, y por qué "agregar un mejor prompt de sistema" no es una estrategia. Parte 2 — Antes de que el Modelo Responda (Sagnik Nath, Profesor Asistente, Ciencias de la Computación, UC Santa Cruz) Tus prompts ahora están fijos. Genial. Mientras tanto, el backend de inferencia está reutilizando estados en caché, haciendo coincidencias difusas con respuestas antiguas y confiando en hashes que fueron diseñados para velocidad, pero no para seguridad. Esta charla explora cómo los caches de prefijo, semánticos y multimodales pueden ser envenenados para alterar respuestas, ocultar entradas maliciosas y evitar auditorías basadas en LLM en sistemas de servicio compartido. Examinaremos ataques demostrados contra marcos como vLLM y GPTCache, y luego discutiremos defensas prácticas para asegurar la capa de caché. 📍 Hacker Dojo, Mountain View 🕕 2:30pm El mismo formato de grupo pequeño que la última vez. Trae un documento que has estado masticando, un hallazgo que tienes en mente, una cadena de explotación que estás desarrollando, o una defensa que quieres poner a prueba ante personas que te desafiarán. La agenda será nuestra referencia de anclaje. Aún más valioso es lo que la sala quiera profundizar. Para asistir, o presentar un documento/proyecto/cualquier cosa relacionada con la seguridad de IA, contacta por correo electrónico a [email protected].
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.
