
Quebrando a Segurança dos Modelos de IA
Descrição
Duas palestras esta semana. Uma fecha um ciclo, a outra abre um buraco de coelho. Parte 1 — Defesas contra Injeção de Prompt: O que Funciona, O que é Teatro (Arshi Chadha, Engenheiro Sênior de Cibersegurança, Zscaler, 20 min) Última sessão: 11 classes de ataque, CVEs. Esta sessão: o lado da defesa. Quais mitigadores realmente funcionam, quais apenas parecem seguros e por que "adicionar um prompt de sistema melhor" não é uma estratégia. Parte 2 — Antes que o Modelo Responda (Sagnik Nath, Professor Assistente, Ciência da Computação, UC Santa Cruz) Seus prompts agora estão fixos. Legal. Enquanto isso, o backend de inferência está reutilizando estados em cache, correspondendo de forma imprecisa a respostas antigas e confiando em hashes que foram projetados para velocidade, mas não para segurança. Esta palestra explora como caches prefixo, semânticos e multimodais podem ser envenenados para alterar respostas, ocultar entradas maliciosas e contornar auditorias baseadas em LLM em sistemas de serviço compartilhado. Vamos examinar ataques demonstrados contra frameworks como vLLM e GPTCache, e depois discutir defesas práticas para proteger a camada de cache. 📍 Hacker Dojo, Mountain View 🕕 14:30 Mesma formato de pequeno grupo que da última vez. Traga um artigo que você tem analisado, uma descoberta que você está segurando, uma cadeia de exploração que você está trabalhando, ou uma defesa que você quer testar diante de pessoas que irão contestar. A agenda será nossa referência de âncora. Mesmo mais valioso é o que a sala quiser aprofundar. Para participar ou apresentar um artigo/projeto/qualquer coisa relacionada à segurança de IA, entre em contato por e-mail em [email protected].
Localização do evento
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.
