
Optymalizacja ciągłego RL w Fireworks: Rollout, Nagroda, Aktualizacja, Powtórzenie!
Opis
Dowiedz się, jak Fireworks.ai prowadzi ciągłe uczenie się poprzez wzmocnienie dla LLM-ów w produkcji podczas tego internetowego spotkania technicznego w dniu 17 sierpnia 2026 o 17:00. Pętla uczenia się poprzez wzmocnienie brzmi prosto, rollout, nagroda, aktualizacja wag, ale utrzymanie tej pętli skutecznej w produkcji zależy od podstawowego przetwarzania danych oraz projektu środowiska uczenia się. Sesja z AI Performance Engineering Meetup (Londyn–Cambridge) bada decyzje inżynieryjne, które decydują o tym, czy model faktycznie uczy się w trakcie ciągłego post-uczenia. ## Wewnątrz pętli RL w produkcji W głównym wystąpieniu, „Rollout, Nagroda, Aktualizacja, Powtórzenie: Jak Fireworks optymalizuje ciągłe post-uczenie,” Sinan Ozdemir z Fireworks.ai przeprowadzi przez sesję uczenia się poprzez wzmocnienie po treningu na Kimi K3, wykorzystując bezserwerowe API Fireworks. Prezentacja zbada, jak kluczowe wybory wpływają na proces treningowy, w tym: - Algorytmy RL i funkcje straty - Wybór rangi LoRA i hiperparametrów - Projekt nagrody - Fazy rollout, oceny i aktualizacji wag - Przetwarzanie danych dla ciągłych przepływów produkcyjnych - Warunki, które pomagają modelowi uczyć się lub zapobiegają jego nauce Zamiast traktować każde ustawienie w izolacji, wykład koncentruje się na tym, jak całe środowisko uczenia kształtuje zachowanie modelu. Uczestnicy mogą oczekiwać praktycznego, zorientowanego na systemy spojrzenia na ciągłe RL dla dużych modeli językowych, opartego na przetrenowanej sesji. ## Format i publiczność Wydarzenie rozpoczyna się od wprowadzeń i aktualizacji spotkania prowadzonego przez Chrisa Fregly i Antje Barth, a następnie następuje techniczna prezentacja Sinana Ozdemira. Odbywa się online za pośrednictwem Zoom jako część cyklicznej serii spotkań, które odbywają się w trzeci poniedziałek miesiąca. Sesja jest szczególnie istotna dla inżynierów AI i uczenia maszynowego, praktyków LLM, inżynierów wydajności, badaczy oraz technicznych twórców zainteresowanych uczeniem przez wzmocnienie, post-uczeniem modelu oraz infrastrukturą AI w produkcji. Tematyka jest techniczna; brak jest określonego poziomu wymagań formalnych na stronie wydarzenia.… Zarejestruj się na to wydarzenie
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.
