
Optimierung von kontinuierlichem RL bei Fireworks: Rollout, Belohnung, Aktualisierung, Wiederholung!
Beschreibung
Erfahren Sie, wie Fireworks.ai kontinuierliches Reinforcement Learning für LLMs in der Produktion bei diesem technischen Online-Meetup am 17. August 2026 um 17:00 Uhr umsetzt. Der Reinforcement-Learning-Zyklus klingt einfach, Rollout, Belohnung, Gewicht aktualisieren, aber die Effektivität dieses Zyklus in der Produktion hängt von der zugrunde liegenden Dateninfrastruktur und dem Design der Lernumgebung ab. Diese Sitzung des AI Performance Engineering Meetup (London–Cambridge) untersucht die ingenieurtechnischen Entscheidungen, die darüber bestimmen, ob ein Modell während des kontinuierlichen Nachtrainings tatsächlich lernt. ## Innerhalb eines Produktions-RL-Zyklus Im Hauptvortrag „Rollout, Belohnung, Aktualisierung, Wiederholung: Wie Fireworks kontinuierliches Nachtraining optimiert,“ wird Sinan Ozdemir von Fireworks.ai einen Nachtraining-Reinforcement-Learning-Prozess auf Kimi K3 unter Verwendung der serverlosen API von Fireworks erläutern. Die Präsentation wird erkunden, wie zentrale Entscheidungen über den Trainingsprozess hinweg interagieren, darunter: - RL-Algorithmen und Verlustfunktionen - LoRA-Rang und Hyperparameterauswahl - Belohnungsdesign - Rollout-, Bewertungs- und Gewicht Aktualisierungsphasen - Dateninfrastruktur für kontinuierliche Produktions-Workflows - Die Bedingungen, die einem Modell helfen zu lernen oder es daran hindern, zu lernen Anstatt jede Einstellung isoliert zu betrachten, konzentriert sich der Vortrag darauf, wie die vollständige Lernumgebung das Verhalten des Modells prägt. Die Teilnehmer können eine praktische, systemorientierte Sicht auf kontinuierliches RL für große Sprachmodelle erwarten, die in einer durchgeführten Nachtrainingseinheit verankert ist. ## Format und Publikum Die Veranstaltung beginnt mit Einführungen und Meetup-Updates von Chris Fregly und Antje Barth, gefolgt von der technischen Präsentation von Sinan Ozdemir. Sie findet online über Zoom statt und ist Teil der wiederkehrenden dritten Montag-Meetup-Serie der Gruppe. Diese Sitzung ist besonders relevant für KI- und Machine-Learning-Ingenieure, LLM-Praktiker, Performance-Ingenieure, Forscher und technische Entwickler, die an Reinforcement Learning, Modellnachtraining und Produktions-KI-Infrastruktur interessiert sind. Das Thema ist technisch; auf der Veranstaltungsseite sind keine formalen Vorkenntnisse angegeben.… Registrieren Sie sich für diese Veranstaltung
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
