
Servindo Novas Arquiteturas de LLM em Produção
Descrição
Arquiteturas modernas de LLM estão evoluindo rapidamente, mas transformar novas ideias em um serviço de produção confiável e de alto desempenho continua sendo um desafio sistemático. Junte-se a vLLM × Ant Ling para uma conversa técnica sobre o que é necessário para suportar e otimizar arquiteturas emergentes de LLM na prática. Desde abstrações de tempo de execução e gerenciamento de memória até integração de modelos, perfilagem e otimização ciente de aceleradores, vamos explorar como equipes de engenharia passam do suporte à arquitetura inicial para desempenho real em produção. Se você constrói infraestrutura de inferência, desenvolve modelos ou otimiza sistemas de IA em larga escala, esta sessão oferecerá insights práticos sobre como levar arquiteturas de LLM de próxima geração para a produção.
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.