
Grupo de Lectura sobre Seguridad de IA: CODA
Descripción
Esta semana, discutiremos el artículo: "Aprendizaje Subliminal: Los Modelos de Lenguaje Transmiten Rasgos de Comportamiento a través de Señales Ocultas en los Datos". Cena, boba proporcionada para los primeros 20 que confirmen asistencia semanalmente (antes del viernes por la mañana). Para evitar el desperdicio de comida, por favor solo confirma tu asistencia si vas a presentarte. Si no tienes acceso a CODA, por favor llega a más tardar a las 4:55pm. La Iniciativa de Seguridad de IA en Georgia Tech es una comunidad de investigadores técnicos y de políticas en Georgia Tech que busca reducir los riesgos de la inteligencia artificial avanzada. Como tal, nos enfocamos en temas que incluyen: Nuestro trabajo reciente incluye AuditBench: Evaluación de Técnicas de Auditoría de Alineación en Modelos con Comportamientos Ocultos y Una Evaluación de Seguridad Independiente de Kimi K2.5. Un resumen detallado de nuestra investigación se puede encontrar aquí. El objetivo de este grupo de lectura es presentar el talento de investigación técnica de GT a los problemas mencionados, enfoques soluciones actuales, y dar vida y ejecutar investigaciones impactantes. Detalles de reuniones pasadas aquí.
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.