Veranstaltung einreichen
Tianyi Alex Qiu | Berechnung der idealen menschlichen Präferenz, Durchbrechung von KI-Feedback-Schleifen

Tianyi Alex Qiu | Berechnung der idealen menschlichen Präferenz, Durchbrechung von KI-Feedback-Schleifen

18 Dez 202610:00 - 11:00 America/Los_AngelesOnline0 TeilnehmerOpen

Beschreibung

Foresight Institute’s Computation Group Berechnung der idealen menschlichen Präferenz, Durchbrechung von KI-Feedback-SchleifenZusammenfassung: Wie sollte ein KI-System jemandem helfen, dessen Überzeugungen und Präferenzen sich noch entwickeln, während er unter dem Einfluss solcher KI-Systeme steht? Klassische Ansätze, die auf Präferenzlernen und inverser Verstärkung lernen, verwechseln oft vorübergehende / instrumentelle Präferenzen (z. B. Geld) mit stabilen / terminalen (z. B. Wohlbefinden). Erstere sind veränderlich, während letztere stationär sind. Indem sie die Stationarität beider annehmen, zeigen sich klassische Methoden, die vorübergehende / instrumentelle Überzeugungen und Präferenzen des menschlichen Hauptakteurs verfestigen, über die sie sich andernfalls später ärgern würden. Um dieses Problem zu vermeiden, entfernen wir die Annahme der Stationarität und schlagen das alternative Ziel vor, die ideale Präferenz des Menschen zu lernen, d. h. den Zustand der menschlichen Überzeugung / Präferenz, der nach ausreichender Reflexion und im Angesicht von sokratischer Gegenüberredung maximal stabil ist. Wir zeigen, wie dieses Ziel formalisiert und in der Praxis berechnet werden kann, wenn Sprachmodellassistenten trainiert werden. Biografie: Tianyi leitet Prevail, eine unabhängige Gruppe, die sich mit epistemischer Entmündigung beschäftigt. Sie entwickeln Trainings- / Bewertungsinterventionen (oft mit Menschen im Prozess) und systematische Maßnahmen, die auf Fehlerquellen abzielen, wie z. B. langfristige Werteinsperrung, und ermögliche gute Ergebnisse wie moralischen / Wissensfortschritt. Tianyi ist Forscher am Oxford HAI Lab, Doktorand im 0. Jahr an der Stanford CS und ehemaliger Anthropic AI Safety Fellow. Die Forschungsprojekte, die er geleitet hat, haben zwei Best Paper Awards erhalten: einen bei ACL'25 und einen beim NeurIPS'24 Pluralistic Alignment Workshop. https://tianyiqiu.net/ Computationsgruppe Eine Gruppe von Wissenschaftlern, Ingenieuren und Unternehmern in den Bereichen Informatik, ML, Kryptographie und verwandten Bereichen, die diese Technologien nutzen, um die freiwillige Zusammenarbeit zwischen Menschen und letztlich KI zu verbessern. Zoom-Link: https://us02web.zoom.us/j/81623367983

Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind

Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.

Related events

Plattform für künstliche Intelligenz

from $10
Tickets kaufen