
Modelle der KI-Sicherheit brechen
Beschreibung
Zwei Vorträge in dieser Woche. Einer schließt einen Kreis, einer eröffnet ein Kaninchenloch. Teil 1 — Verteidigung gegen Eingabeaufforderungen: Was funktioniert, was ist Theater (Arshi Chadha, leitender Cybersicherheitstechniker, Zscaler, 20 min) Letzte Sitzung: 11 Angriffs Klassen, CVEs. Diese Sitzung: die Verteidigung. Welche Abhilfen halten tatsächlich stand, welche fühlen sich nur sicher an und warum „füge einen besseren Systemprompt hinzu“ keine Strategie ist. Teil 2 — Bevor das Modell antwortet (Sagnik Nath, Assistenzprofessor, Informatik, UC Santa Cruz) Ihre Aufforderungen sind jetzt festgelegt. Cool. In der Zwischenzeit verwendet das Inferenz-Backend zwischengespeicherte Zustände, um alte Antworten verschwommen abzugleichen und vertraut auf Hashes, die für Geschwindigkeit, aber nicht für Sicherheit konzipiert wurden. Dieser Vortrag untersucht, wie Präfix-, semantische und multimodale Caches vergiftet werden können, um Antworten zu ändern, bösartige Eingaben zu verbergen und LLM-basierte Prüfungen in gemeinsam genutzten Serversystemen zu umgehen. Wir werden Angriffe untersuchen, die gegen Frameworks wie vLLM und GPTCache demonstriert wurden, und dann praktische Verteidigungen zur Sicherung der Cache-Schicht diskutieren. 📍 Hacker Dojo, Mountain View 🕕 14:30 Uhr Dasselbe Kleingruppenformat wie beim letzten Mal. Bringen Sie ein Papier mit, über das Sie nachdenken, eine Erkenntnis, auf der Sie sitzen, eine Exploit-Kette, an der Sie arbeiten, oder eine Verteidigung, die Sie vor Leuten testen möchten, die zurückdrängen werden. Die Agenda wird unser Ankerreferenzpunkt sein. Noch wertvoller ist, was auch immer der Raum ausprobieren möchte. Um teilzunehmen oder ein Papier/Projekt/irgendetwas, das mit KI-Sicherheit zu tun hat, zu präsentieren, kontaktieren Sie uns per E-Mail unter [email protected].
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
