Dodaj wydarzenie
Andrey prezentuje "Geometria odmowy odzwierciedla trening odmowy"

Andrey prezentuje "Geometria odmowy odzwierciedla trening odmowy"

15 wrz 20266:30 PM GMT-07:00OnlineOpen
Learn
TextData

Opis

Geometria odmowy odzwierciedla trening odmowy: różnorodne prefiksy odmowy mogą podnieść stabilną rangę i osłabić ataki ablacyjne wektora odmowy. Streszczenie Trening odmowy chroni modele AI przed jailbreakami, ucząc modele odmawiania niebezpiecznym zapytaniom, co zmniejsza ryzyko nadużyć. Ostatnie prace wykazały, że zachowanie odmowy w dopasowanych modelach językowych może być uwarunkowane przez pojedynczy kierunek aktywacji lub niskowymiarową podprzestrzeń odmowy wspólną dla szkodliwych zapytań: ablacja tych kierunków tłumi odmowy przy jednoczesnym zachowaniu innych możliwości modelu. Jednak nadal nie jest jasne, dlaczego cechy krytyczne dla bezpieczeństwa w szerokim zakresie modeli pojawiają się w skoncentrowanej, niskowymiarowej strukturze. W badaniu przypadku OLMo-2-0425-1B-Instruct odkrywamy, że geometria odmowy odzwierciedla trening odmowy: aktualizacje aktywacji wynikające z strat pierwszego tokena związanych z odmową wyjaśniają powstały kierunek odmowy i podprzestrzeń odmowy. Badamy kierunki odmowy przez dynamikę treningu w zestawach danych odmowy i ujawniamy, że ich kruchość jest związana z powtarzalnymi początkami odmowy, które z kolei są powiązane z koncentracją gradientów i cechami odmowy w niskowymiarowej podprzestrzeni. W ramach analiz zamrożonych modeli i kontrolowanego syntetycznego dostosowywania, znajdujemy dowody na twarde dźwignie: różnorodne początki odmowy mogą podnieść stabilne rangi gradientów i zmian aktywacji, co utrudnia usunięcie odmowy za pomocą ataku ablacyjnego wektora. Praca https://arxiv.org/abs/2608.25390

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Powiązane wydarzenia

Platforma sztucznej inteligencji

Ceny na stronie