
אנדרי מציג "גיאומטריית סירוב משקפת הכשרת סירוב"
תיאור
גיאומטריית סירוב משקפת הכשרת סירוב: תחיליות סירוב שונות יכולות להעלות דרגה יציבה ולחזק התקפות חיסול של וקטור הסירוב. תקציר הכשרת סירוב מגנה על מודלים של AI מפגיעות על ידי הכשרת מודלים לדחות שאילתות לא בטוחות, מה שמפחית את הסיכון לשימוש לרעה. עבודה עדכנית מגלה שהתנהגות הסירוב במודלים שיח מלוכדים יכולה להיות מתווכת על ידי כיוון הפעלה יחיד או תת-מרחב סירוב נמוך ממדי המשותף בין פקודות מזיקות: חיסול כיוונים אלו מדכא סירובים תוך שמירה בעיקר על יכולות מודל אחרות. עם זאת, עדיין לא ברור מדוע תכונות קריטיות לבטיחות במגוון רחב של מודלים מתגבשות בתוך מבנה מרוכז, נמוך ממדי. במקרה של OLMo-2-0425-1B-Instruct, אנו מוצאים שגיאומטריית הסירוב משקפת הכשרת סירוב: עדכוני הפעלה הנובעים מאיבוד טוקן ראשון של השלמת סירוב מסבירים את כיוון הסירוב ותת-הממדי של הסירוב. אנו חוקרים את כיווני הסירוב דרך הדינמיקה של ההכשרה ברחבי מערכי נתוני סירוב ומגלים שפריכותם קשורה להתחלות סירוב חוזרות, אשר קשורות בתורן לצמצום של גרדיאנטים ותכונות סירוב בתת-מרחב נמוך ממדי. דרך ניתוחים של מודלים קפואים וכיוון מפוקח סינתטי, אנו מוצאים ראיות למנוף הקשחה: תחיליות סירוב מגוונות יכולות להעלות דרגות יציבות של גרדיאנטים ושינויים בהפעלה, מה שהופך את הסירובים לקשים יותר להסרה באמצעות התקפת חיסול וקטורי. נייר https://arxiv.org/abs/2608.25390
תן לרשת שלך לדעת שאתה הולך
שתף אירוע זה כדי להתחיל שיחות, להזמין עמיתים ולהתחבר לפני תחילתו.






