
Grupa Czytelnicza Bezpieczeństwa AI: CODA
Opis
W tym tygodniu będziemy omawiać artykuł: "Uczące się Subliminalnie: Modele Językowe Przekazują Cecha Behawioralne za Pośrednictwem Ukrytych Sygnałów w Danych". Kolacja, boba zapewniona dla pierwszych 20 osób, które potwierdzą obecność co tydzień (przed piątkiem rano!) Aby uniknąć marnowania jedzenia, prosimy o potwierdzenie tylko jeśli zamierzasz przyjść. Jeśli nie masz dostępu do CODA, przyjdź najpóźniej o 16:55. Inicjatywa Bezpieczeństwa AI na Georgia Tech to społeczność badaczy technicznych i politycznych na Georgia Tech, mająca na celu zmniejszenie ryzyka związanego z zaawansowaną sztuczną inteligencją. W związku z tym koncentrujemy się na tematach takich jak: Nasza niedawna praca obejmuje AuditBench: Ocena Technik Audytowych Wyrównania w Modelach z Ukrytymi Zachowaniami oraz Niezależną Ewaluację Bezpieczeństwa Kimi K2.5. Szczegółowy przegląd naszych badań można znaleźć tutaj. Celem tej grupy czytelniczej jest wprowadzenie talentu badawczego technicznego z GT w wyżej wymienione problemy, obecne podejścia/rozwiązania oraz narodziny i realizację wpływowych badań. Szczegóły poprzednich spotkań tutaj.
Lokalizacja wydarzenia
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.