Veranstaltung einreichen
Andrey präsentiert "Die Geometrie der Ablehnung spiegelt das Ablehnungstraining wider"

Andrey präsentiert "Die Geometrie der Ablehnung spiegelt das Ablehnungstraining wider"

15 Sep 20266:30 PM GMT-07:00OnlineOpen
Learn
TextData

Beschreibung

Die Geometrie der Ablehnung spiegelt das Ablehnungstraining wider: verschiedene Ablehnungsprefixe können den stabilen Rang erhöhen und Angriffe mit Ablehnungvektor-Ablation schwächen. Zusammenfassung: Das Ablehnungstraining schützt KI-Modelle vor Jailbreaks, indem es Modelle trainiert, unsichere Anfragen abzulehnen, was das Risiko des Missbrauchs verringert. Jüngste Arbeiten haben ergeben, dass das Ablehnungsverhalten in abgestimmten Sprachmodellen durch eine einzelne Aktivierungsrichtung oder einen niederdimensionalen Ablehnungsunterraum, der über schädliche Eingabeaufforderungen geteilt wird, vermittelt werden kann: Das Ablatieren dieser Richtungen unterdrückt Ablehnungen, während die anderen Fähigkeiten des Modells weitgehend erhalten bleiben. Dennoch bleibt unklar, warum sicherheitskritische Merkmale in einer Vielzahl von Modellen in einer konzentrierten, niederdimensionalen Struktur auftreten. In einer Fallstudie zu OLMo-2-0425-1B-Instruct stellen wir fest, dass die Geometrie der Ablehnung das Ablehnungstraining widerspiegelt: Aktivierungsupdates, die sich aus Verlusten des ersten Tokens bei Ablehnungsabschlüssen ergeben, erklären die resultierende Ablehnungsrichtung und den Ablehnungsunterraum. Wir untersuchen Ablehnungsrichtungen durch die Trainingsdynamik über Ablehnungsdatensätze und zeigen, dass ihre Zerbrechlichkeit mit repetitiven Ablehnungsstarts assoziiert ist, die wiederum mit der Konzentration von Gradienten und Ablehnungsmerkmalen in einem niederdimensionalen Unterraum verbunden sind. In Analysen von eingefrorenen Modellen und kontrolliertem synthetischem Fine-Tuning finden wir Beweise für einen härter werdenden Hebel: verschiedene Ablehnungsstarts können stabile Ränge von Gradienten und Aktivierungsänderungen erhöhen, was es schwieriger macht, Ablehnungen durch einen Vektor-Ablationsangriff zu entfernen. Papier https://arxiv.org/abs/2608.25390

Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind

Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.

Verwandte Events

Plattform für künstliche Intelligenz

Preise auf der Website