
Andrey apresenta "A geometria da recusa reflete o treinamento de recusa"
Descrição
A geometria da recusa reflete o treinamento de recusa: diversos prefixos de recusa podem elevar o ranking estável e enfraquecer ataques de ablação de vetor de recusa. Resumo: O treinamento de recusa protege modelos de IA contra jailbreaks treinando modelos para recusar consultas inseguras, reduzindo o risco de uso indevido. Trabalhos recentes descobrem que o comportamento de recusa em modelos de linguagem alinhados pode ser mediado por uma única direção de ativação ou um subespaço de recusa de baixa dimensão compartilhado entre solicitações prejudiciais: ablar essas direções suprime as recusas enquanto preserva amplamente outras capacidades do modelo. No entanto, ainda não está claro por que características críticas de segurança em uma ampla gama de modelos emergem em uma estrutura concentrada e de baixa dimensão. Em um estudo de caso do OLMo-2-0425-1B-Instruct, descobrimos que a geometria da recusa reflete o treinamento de recusa: atualizações de ativação resultantes de perdas token de primeiro reconhecimento da recusa explicam a direção de recusa resultante e o subespaço de recusa. Estudamos direções de recusa através da dinâmica de treinamento em conjuntos de dados de recusa e revelamos que sua fragilidade está associada a inícios repetitivos de recusa, que por sua vez estão ligados à concentração de gradientes e características de recusa em um subespaço de baixa dimensão. Através de análises de modelos congelados e ajuste fino sintético controlado, encontramos evidências de uma alavanca de endurecimento: inícios de recusa diversos podem elevar os rankings estáveis de gradientes e mudanças de ativação, tornando as recusas mais difíceis de remover com um ataque de ablação de vetor. Artigo https://arxiv.org/abs/2608.25390
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.






