
Diskussion über Forschungsarbeiten
Beschreibung
Diskussion über die mechanistische Interpretierbarkeit - Identifizierung menschlich interpretierbarer Konzepte und Algorithmen in LLMs Lesen Sie einige der AI-Schlagzeilen der letzten Wochen. Wenn Sie immer noch denken, dass Interpretierbarkeit und die Verbesserung unseres Verständnisses von LLMs nicht wichtig sind, lesen Sie sie noch einmal. Im Allgemeinen zielt mechanistische Interpretierbarkeit darauf ab, die Algorithmen zu entdecken, zu verstehen und zu verifizieren, die durch Rückentwicklung der Modellen gewichtete Implementierungen in menschlich verständliche Komponenten umsetzen. Konkret wollen wir in dieser Sitzung das Papier „Interpretability in the Wild“ betrachten (https://openreview.net/pdf?id=NpsVSN6o4ul). Es identifiziert einen Schaltkreis zur indirekten Objekterkennung im GPT-2 kleinen Modell und war ein einflussreicher realer Nachweis des Konzepts in diesem Bereich. Bitte lesen Sie vor der Sitzung das Papier (https://openreview.net/pdf?id=NpsVSN6o4ul). Je mehr Fragen Sie nach dem Lesen haben, desto produktiver wird die Sitzung sein! Sie können sich auch dieses praktischere Kapitel über Interpretierbarkeit zu demselben Papier ansehen: https://learn.arena.education/chapter1_transformer_interp/21_ioi/intro.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.










