
Können Agenten sich tatsächlich selbst verbessern?
Beschreibung
Ein praktischer Abend, an dem ein Agent entwickelt wird, der nachweislich besser wird: Simulieren Sie die Randfälle, bewerten Sie gegen Auswertungen und überprüfen Sie jede Veröffentlichung, sodass die nächste Version nur versandt wird, wenn sie die letzte übertrifft. Sie werden mit dem Loop, der auf Open-Source-Tools basiert, auf einem Laptop gehen. Veranstaltungsdetails: "Selbstverbessernde Agenten" ist gerade in Pitch-Decks sehr gefragt. Ein Teil davon ist echt, ein Großteil jedoch nicht, und dieser Abend trennt die beiden, indem die echte Version vor Ihnen erstellt wird. Gemeinsam werden wir die echte Version live erstellen, um den Unterschied zu zeigen. Bevor irgendetwas in die Produktion geht, simulieren wir synthetische Benutzer und gegnerische Szenarien, um herauszufinden, wo der Agent versagt, bewerten diese Durchgänge gegen Auswertungen und speisen die Fehler wieder ein. Die Auswertung wird zum Gate: Nichts wird versandt, es sei denn, die Zahlen bewegen sich in die richtige Richtung. Dann halten wir es am Laufen und leiten den Produktionsverkehr zurück durch dieselben Auswertungen, sodass Rückschläge als fallende Punktzahlen statt als Support-Tickets erscheinen. Vollständige rekursive Selbstverbesserung ist immer noch ein offenes Forschungsproblem, und wir wollen nicht so tun, als wäre es anders, aber die begrenzte Version ist heute auf OpenTelemetry und Open-Source-Frameworks umsetzbar, die Sie forken und selbst hosten können. Workshop-Leiter Nikhil, Gründer und CEO von Future AGI, leitet den Live-Bau von Ende zu Ende. Er verbringt seine Tage mit dem genauen Problem, das dieser Abend behandelt: Agenten zuverlässig genug zu machen, um ihnen in der Produktion zu vertrauen, und messbar genug, um zu wissen, dass sie sich tatsächlich verbessern. Bringen Sie einen Laptop mit um: Eine Basislinie-Agent mit OpenTelemetry zu instrumentieren und dessen Startbewertung zu erfassen Synthetische Benutzer und gegnerische Szenarien zu simulieren, um ihn absichtlich zu brechen Die Durchgänge gegen Auswertungen zu bewerten, sodass Fehler zu Zahlen und nicht zu Anekdoten werden Die Traces zu lesen, um die tatsächliche Ursache zu finden und nicht vom Output zu raten Die Lösungen wieder einzufüttern und dann erneut zu simulieren, um zu bestätigen, dass sich die Punktzahlen bewegt haben Das Versenden zu steuern: eine neue Version nur zu befördern, wenn sie die letzte übertrifft Produktionsverkehr zurück durch die gleichen Auswertungen zu leiten, um es kontinuierlich zu verbessern Agenda 17:30 - Snacks & Begrüßungen 18:00 - Gastredner (wird angekündigt) 19:00 - Live-Bau: der Selbstverbesserungsloop, der tatsächlich versendet wird (Laptop mitbringen) 19:30 - Offene Debatte & Q&A: Hype gegen das, was funktioniert 20:00 - Networking 20:30 - Wir sehen uns in der nächsten Iteration Für Ingenieure und KI-Produktentwickler, die Agenten in der Produktion betreiben und die Version möchten, die nachweislich verbessert wird, basierend auf offenen Werkzeugen, die sie behalten können.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.







