
Otimização do RL Contínuo na Fireworks: Execução, Recompensa, Atualização, Repetir!
Descrição
Aprenda como a Fireworks.ai executa aprendizado por reforço contínuo para LLMs em produção neste encontro técnico online em 17 de agosto de 2026 às 17:00. O ciclo de aprendizado por reforço parece simples, execução, recompensa, atualização de pesos, mas manter esse ciclo eficaz em produção depende da infraestrutura de dados subjacente e do design do ambiente de aprendizado. Esta sessão do AI Performance Engineering Meetup (Londres–Cambridge) examina as decisões de engenharia que determinam se um modelo realmente aprende durante o pós-treinamento contínuo. ## Dentro de um ciclo de RL em produção Na palestra principal, “Execução, Recompensa, Atualização, Repetir: Como a Fireworks Otimiza o Pós-Treinamento Contínuo,” Sinan Ozdemir da Fireworks.ai fará uma demonstração de uma sessão de aprendizado por reforço pós-treinamento no Kimi K3 usando a API sem servidor da Fireworks. A apresentação explorará como as escolhas principais interagem ao longo do processo de treinamento, incluindo: - Algoritmos de RL e funções de perda - Seleção de hyperparâmetros e classificação LoRA - Design de recompensas - Estágios de execução, avaliação e atualização de pesos - Infraestrutura de dados para fluxos de trabalho de produção contínua - As condições que ajudam um modelo a aprender ou o impedem de aprender Em vez de tratar cada configuração de forma isolada, a palestra foca em como o ambiente de aprendizado completo molda o comportamento do modelo. Os participantes podem esperar uma visão prática e orientada a sistemas do RL contínuo para grandes modelos de linguagem, fundamentada em uma sessão de pós-treinamento trabalhada. ## Formato e público O evento começa com introduções e atualizações do encontro por Chris Fregly e Antje Barth, seguido pela apresentação técnica de Sinan Ozdemir. Acontece online via Zoom como parte da série recorrente de encontros na terceira segunda-feira do grupo. Esta sessão é particularmente relevante para engenheiros de IA e aprendizado de máquinas, praticantes de LLM, engenheiros de desempenho, pesquisadores e construtores técnicos interessados em aprendizado por reforço, pós-treinamento de modelos e infraestrutura de IA em produção. O assunto é técnico; nenhum nível de pré-requisito formal é especificado na página do evento.… Registre-se para este evento
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.
