
ModelOps Nacht: Bewertungen, Routing & Benchmarks
Beschreibung
Ein technischer Tiefgang zur Bewertung von KI-Produkten, Agenten und Workflows anhand realer Aufgaben.Während Modelle besser werden, ist die schwierige Frage nicht mehr nur "welches Modell ist das beste?" Es ist, ob Ihr Produkt, Agent oder Workflow tatsächlich gut bei den Aufgaben funktioniert, die für Ihre Nutzer wichtig sind.Öffentliche Benchmarks erfassen selten Ihre Randfälle. Reale Produktionssysteme haben chaotische Eingaben, mehrstufige Workflows, Toolaufrufe, Latenz-Constraints, Kosten-Nutzen-Abwägungen und Fehlermodi, die nur in der Praxis auftreten.Diese Veranstaltung bringt Teams zusammen, die die Infrastruktur zur Bewertung von KI-Systemen in der realen Welt aufbauen.Wir hören von Composio über den Aufbau von Bewertungen für reale Workflows, von GMI Cloud über das Routing von Modellen zur Optimierung von Leistung und Ausgaben, von Handshake über die Erstellung hochwertiger Benchmarks, die die Grenze definieren, und von Oqoqo über die Bewertung und Verbesserung der Agentenerfahrung durch den Aufbau eigener Benchmarks.Wenn Sie Werkzeuge für Agenten, benutzerdefinierte Agenten oder interne Workflows entwickeln, ist dies ein Raum für praktische Gespräche darüber, wie man misst, was tatsächlich funktioniert.Programm17:30 Türen öffnen · Essen & Getränke18:00 Composio: Bewertungen für reale Workflows erstellen (Jayesh Sharma, KI-Ingenieur bei Composio)18:15 GMI Cloud: Routing von Modellen zur Optimierung von Leistung und Ausgaben18:30 Handshake: Benchmarks für wirtschaftlich wertvolle Agentenarbeiten erstellen (Jonas Mueller, Direktor für KI-Forschung, Handshake AI)18:45 Oqoqo: Bewertung und Verbesserung der Agentenerfahrung durch den Aufbau eigener Benchmarks (Haritha Nair, CTO, Oqoqo)19:00 NetworkingWer sollte kommenGründer, Produktingenieure, KI-Ingenieure und Teams, die Agenten / agentenorientierte Produkte, interne Workflows oder Systeme entwickeln, die gegen reale Benutzeraufgaben getestet werden müssen.
Höhepunkte
Technischer Tiefgang zur Bewertung von KI-Produkten und WorkflowsAdressierung realer Aufgaben und Randfälle in KI-SystemenPräsentationen von Composio, GMI Cloud, Handshake und OqoqoThemen umfassen den Aufbau von Bewertungen, Modellentrouting und die Erstellung von BenchmarksNetworking-Möglichkeiten mit KI-Ingenieuren und Produktteams
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
