
Optimisation du RL continu chez Fireworks : Déploiement, Récompense, Mise à jour, Répéter !
Description
Découvrez comment Fireworks.ai exécute l'apprentissage par renforcement continu pour les LLM en production lors de cette rencontre technique en ligne le 17 août 2026 à 17h00. La boucle d'apprentissage par renforcement semble simple, déploiement, récompense, mise à jour des poids, mais maintenir cette boucle efficace en production dépend de la plomberie des données sous-jacente et de la conception de l'environnement d'apprentissage. Cette session du AI Performance Engineering Meetup (Londres–Cambridge) examine les décisions d'ingénierie qui déterminent si un modèle apprend réellement pendant l'apprentissage post-entraînement continu. ## À l'intérieur d'une boucle RL en production Dans la présentation principale, « Déploiement, Récompense, Mise à jour, Répéter : Comment Fireworks optimise le post-entraînement continu », Sinan Ozdemir de Fireworks.ai expliquera une session d'apprentissage par renforcement post-entraînement sur Kimi K3 utilisant l'API sans serveur de Fireworks. La présentation explorera comment des choix clés interagissent tout au long du processus d'entraînement, y compris : - Algorithmes RL et fonctions de perte - Sélection du rang LoRA et des hyperparamètres - Conception de récompense - Étapes de déploiement, d'évaluation et de mise à jour des poids - Plomberie des données pour des flux de travail de production continus - Les conditions qui aident un modèle à apprendre, ou l'empêchent d'apprendre Plutôt que de traiter chaque paramètre de manière isolée, la présentation se concentre sur la manière dont l'environnement d'apprentissage complet façonne le comportement des modèles. Les participants peuvent s'attendre à une vue pratique et orientée systèmes de l'apprentissage par renforcement continu pour les modèles de langage de grande taille, fondée sur une session de post-entraînement travaillée. ## Format et public L'événement débute par des présentations et des mises à jour de la rencontre par Chris Fregly et Antje Barth, suivi de la présentation technique de Sinan Ozdemir. Il se déroule en ligne via Zoom dans le cadre de la série de rencontres récurrentes du groupe le troisième lundi. Cette session est particulièrement pertinente pour les ingénieurs en IA et en apprentissage automatique, les praticiens de LLM, les ingénieurs de performance, les chercheurs et les constructeurs techniques intéressés par l'apprentissage par renforcement, l'apprentissage post-entraînement des modèles et l'infrastructure AI en production. Le sujet est technique ; aucun niveau préalable formel n'est spécifié sur la page de l'événement.… Inscrivez-vous à cet événement
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.
