
Optimizando RL Continuo en Fireworks: ¡Rollout, Recompensa, Actualización, Repetir!
Descripción
Aprende cómo Fireworks.ai ejecuta el aprendizaje por refuerzo continuo para LLMs en producción en este encuentro técnico online el 17 de agosto de 2026 a las 5:00 PM. El bucle de aprendizaje por refuerzo suena simple, rollout, recompensa, actualización de pesos, pero mantener ese bucle efectivo en producción depende de la plomería de datos subyacente y el diseño del entorno de aprendizaje. Esta sesión del AI Performance Engineering Meetup (Londres–Cambridge) examina las decisiones de ingeniería que determinan si un modelo realmente aprende durante el entrenamiento post-continuo. ## Dentro de un ciclo RL en producción En la charla principal, “Rollout, Recompensa, Actualización, Repetir: Cómo Fireworks Optimiza el Entrenamiento Post-Continuo,” Sinan Ozdemir de Fireworks.ai recorrerá una sesión de aprendizaje por refuerzo post-entrenamiento en Kimi K3 utilizando la API sin servidor de Fireworks. La presentación explorará cómo las decisiones clave interactúan a lo largo del proceso de entrenamiento, incluyendo: - Algoritmos RL y funciones de pérdida - Selección de rango LoRA y hiperparámetros - Diseño de recompensas - Etapas de rollout, evaluación y actualización de pesos - Plomería de datos para flujos de trabajo de producción continua - Las condiciones que ayudan a un modelo a aprender o lo impiden En lugar de tratar cada configuración en aislamiento, la charla se centra en cómo el entorno de aprendizaje completo da forma al comportamiento del modelo. Los asistentes pueden esperar una visión práctica y orientada a sistemas del RL continuo para grandes modelos de lenguaje, fundamentada en una sesión de entrenamiento post-trabajo. ## Formato y audiencia El evento comienza con introducciones y actualizaciones del encuentro por parte de Chris Fregly y Antje Barth, seguido de la presentación técnica de Sinan Ozdemir. Se lleva a cabo en línea a través de Zoom como parte de la serie de encuentros recurrentes del tercer lunes del grupo. Esta sesión es particularmente relevante para ingenieros de IA y aprendizaje automático, practicantes de LLM, ingenieros de rendimiento, investigadores y constructores técnicos interesados en el aprendizaje por refuerzo, el entrenamiento post-modelo y la infraestructura de IA en producción. La materia es técnica; no se especifica un nivel de requisito formal en la página del evento.… Regístrate para este evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.
