
AI-Sicherheitslesegruppe: CODA
Beschreibung
Diese Woche werden wir das Papier: "Belohnungssuche durch instillierte kontrastive Überzeugungen messen" besprechen. Kostenlose Pizza wird bereitgestellt! Wenn Sie keinen Zugang zu CODA haben, kommen Sie bitte spätestens um 16:55 Uhr. Die AI Safety Initiative an der Georgia Tech ist eine Gemeinschaft von technischen und politischen Forschern an der Georgia Tech, die darauf abzielt, Risiken durch fortgeschrittene künstliche Intelligenz zu reduzieren. Daher konzentrieren wir uns auf Themen wie: Unsere jüngste Arbeit umfasst AuditBench: Bewertung von Techniken zur Überprüfung der Ausrichtung von Modellen mit verborgenen Verhaltensweisen und eine unabhängige Sicherheitsbewertung von Kimi K2.5. Eine umfassende Übersicht über unsere Forschung finden Sie hier. Das Ziel dieser Lesegruppe ist es, das technische Forschungspotenzial von GT mit den oben genannten Problemen, aktuellen Ansätzen/Lösungen sowie der Geburt und Durchführung wirksamer Forschung vertraut zu machen. Details zu vergangenen Treffen hier.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
