
Tianyi Alex Qiu | Berechnung der idealen menschlichen Präferenz, Durchbrechung von KI-Feedback-Schleifen
Beschreibung
Foresight Institute’s Computation Group Berechnung der idealen menschlichen Präferenz, Durchbrechung von KI-Feedback-SchleifenZusammenfassung: Wie sollte ein KI-System jemandem helfen, dessen Überzeugungen und Präferenzen sich noch entwickeln, während er unter dem Einfluss solcher KI-Systeme steht? Klassische Ansätze, die auf Präferenzlernen und inverser Verstärkung lernen, verwechseln oft vorübergehende / instrumentelle Präferenzen (z. B. Geld) mit stabilen / terminalen (z. B. Wohlbefinden). Erstere sind veränderlich, während letztere stationär sind. Indem sie die Stationarität beider annehmen, zeigen sich klassische Methoden, die vorübergehende / instrumentelle Überzeugungen und Präferenzen des menschlichen Hauptakteurs verfestigen, über die sie sich andernfalls später ärgern würden. Um dieses Problem zu vermeiden, entfernen wir die Annahme der Stationarität und schlagen das alternative Ziel vor, die ideale Präferenz des Menschen zu lernen, d. h. den Zustand der menschlichen Überzeugung / Präferenz, der nach ausreichender Reflexion und im Angesicht von sokratischer Gegenüberredung maximal stabil ist. Wir zeigen, wie dieses Ziel formalisiert und in der Praxis berechnet werden kann, wenn Sprachmodellassistenten trainiert werden. Biografie: Tianyi leitet Prevail, eine unabhängige Gruppe, die sich mit epistemischer Entmündigung beschäftigt. Sie entwickeln Trainings- / Bewertungsinterventionen (oft mit Menschen im Prozess) und systematische Maßnahmen, die auf Fehlerquellen abzielen, wie z. B. langfristige Werteinsperrung, und ermögliche gute Ergebnisse wie moralischen / Wissensfortschritt. Tianyi ist Forscher am Oxford HAI Lab, Doktorand im 0. Jahr an der Stanford CS und ehemaliger Anthropic AI Safety Fellow. Die Forschungsprojekte, die er geleitet hat, haben zwei Best Paper Awards erhalten: einen bei ACL'25 und einen beim NeurIPS'24 Pluralistic Alignment Workshop. https://tianyiqiu.net/ Computationsgruppe Eine Gruppe von Wissenschaftlern, Ingenieuren und Unternehmern in den Bereichen Informatik, ML, Kryptographie und verwandten Bereichen, die diese Technologien nutzen, um die freiwillige Zusammenarbeit zwischen Menschen und letztlich KI zu verbessern. Zoom-Link: https://us02web.zoom.us/j/81623367983
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.