
Optimalisatie van Continue RL bij Fireworks: Rolout, Beloning, Update, Herhaal!
Beschrijving
Leer hoe Fireworks.ai continue reinforcement learning voor LLM's in productie uitvoert tijdens deze online technische meetup op 17 augustus 2026 om 17:00 uur. De reinforcement learning loop klinkt eenvoudig, rolout, beloning, gewichtsupdate, maar het effectief houden van die loop in productie hangt af van de onderliggende data-infrastructuur en het ontwerp van de leeromgeving. Deze sessie van de AI Performance Engineering Meetup (Londen–Cambridge) onderzoekt de engineeringbeslissingen die bepalen of een model daadwerkelijk leert tijdens continue post-training. ## Binnen een productie RL-loop In de hoofdlezing, “Rolout, Beloning, Update, Herhaal: Hoe Fireworks Continue Post-Training Optimaliseert,” zal Sinan Ozdemir van Fireworks.ai een post-training reinforcement learning sessie op Kimi K3 doorlopen met behulp van Fireworks’ serverless API. De presentatie zal verkennen hoe belangrijke keuzes elkaar beïnvloeden gedurende het trainingsproces, waaronder: - RL-algoritmen en verliesfuncties - LoRA-rang en hyperparameterselectie - Beloningsontwerp - Rolout, evaluatie en gewichtsupdate-fases - Data-infrastructuur voor continue productie-workflows - De voorwaarden die helpen dat een model leert, of het leren verhinderen In plaats van elke instelling in isolatie te behandelen, richt de lezing zich op hoe de complete leeromgeving het gedrag van het model vormgeeft. Deelnemers kunnen een praktische, systeemgerichte kijk op continue RL voor grote taalmodellen verwachten, gebaseerd op een uitgewerkte post-training sessie. ## Formaat en publiek Het evenement begint met introducties en updates van de meetup door Chris Fregly en Antje Barth, gevolgd door de technische presentatie van Sinan Ozdemir. Het vindt online plaats via Zoom als onderdeel van de terugkerende meetup-serie op de derde maandag van de maand. Deze sessie is bijzonder relevant voor AI- en machine learning-engineers, LLM-practitioners, performance engineers, onderzoekers en technische bouwers die geïnteresseerd zijn in reinforcement learning, modelpost-training en productie AI-infrastructuur. De materie is technisch; er is geen formeel vereiste niveau gespecificeerd op de evenementpagina.… Registreren voor dit evenement
Laat je netwerk weten dat je komt
Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.
