
AI-Sicherheitslesegruppe: CODA
Beschreibung
Diese Woche werden wir das Papier: "Subliminales Lernen: Sprachmodelle übertragen Verhaltensmerkmale über verborgene Signale in Daten" besprechen. Abendessen und Boba werden für die ersten 20 angeboten, die sich wöchentlich (vor Freitagmorgen!) anmelden. Um Lebensmittelverschwendung zu vermeiden, melden Sie sich bitte nur an, wenn Sie auch tatsächlich erscheinen werden. Wenn Sie keinen Zugang zu CODA haben, kommen Sie bitte spätestens um 16:55 Uhr. Die AI Safety Initiative am Georgia Tech ist eine Gemeinschaft von technischen und politischen Forschern am Georgia Tech, die darauf abzielt, die Risiken fortschrittlicher Künstlicher Intelligenz zu verringern. Daher konzentrieren wir uns auf Themen wie: Unsere aktuellen Arbeiten umfassen AuditBench: Bewertung von Techniken zur Überprüfung der Ausrichtung bei Modellen mit verborgenen Verhaltensweisen und eine unabhängige Sicherheitsbewertung von Kimi K2.5. Eine ausführliche Übersicht über unsere Forschung finden Sie hier. Das Ziel dieser Lesegruppe ist es, die technischen Forschungstalente von GT mit den obigen Problemen, aktuellen Ansätzen/Lösungen vertraut zu machen und wirksame Forschung zu initiieren und durchzuführen. Details zu vergangenen Treffen hier.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.