
Grupo de Estudo: Inferência em Sistemas de IA
Descrição
Grupo de Estudo: Inferência de LLM Junte-se ao Coletivo de IA Aplicada para um grupo de estudo prático sobre a inferência de LLM e vLLM — como os modelos de linguagem modernos são servidos de forma eficiente, o que acontece após um prompt chegar a um modelo e como os sistemas de inferência equilibram latência, throughput, memória e custo. À medida que as aplicações de LLM passam de protótipos para produtos do mundo real, executar o modelo de forma eficiente torna-se uma parte importante da pilha de IA. Não é suficiente escolher um modelo capaz — os construtores também precisam entender como esse modelo é implantado, como as solicitações são processadas, como os recursos de GPU são utilizados e como o desempenho da inferência muda à medida que o tráfego aumenta. Esta sessão foi projetada como uma discussão amigável para construtores, engenheiros, fundadores, pesquisadores, criadores de produtos e entusiastas de IA que desejam entender melhor a infraestrutura por trás do serviço de LLMs em produção. O que iremos cobrir: • O que é inferência de LLM e o que acontece durante o serviço do modelo • Pré-preenchimento vs. decodificação e por que eles têm diferentes características de desempenho • Latência, throughput, tokens por segundo e outras métricas importantes de inferência • Como o batching e o batching contínuo melhoram a utilização da GPU • KV caching e por que isso importa para o desempenho da inferência • Uma introdução ao vLLM e como ele possibilita o serviço de LLM de alto throughput • PagedAttention e o problema que foi projetado para resolver • Quantização e outras técnicas para reduzir o custo da inferência e o uso de memória • Servindo modelos de código aberto e pensando sobre GPUs, tamanho do modelo e concorrência • Discussão aberta sobre frameworks de inferência, arquiteturas, benchmarks e desafios de implantação no mundo real Quem deve participar: construtores de IA, engenheiros de software, engenheiros de ML, fundadores, gerentes de produtos, pesquisadores, estudantes e qualquer pessoa interessada em entender como os LLMs são servidos em sistemas do mundo real. Nenhuma experiência anterior em infraestrutura de inferência é necessária. Traga suas perguntas, experiências com ferramentas como vLLM, modelos que você implantou ou sistemas de IA que você está atualmente construindo. Este é um grupo de estudo, não uma palestra formal. O objetivo é aprender juntos, discutir abordagens práticas e construir uma melhor compreensão do que acontece entre uma aplicação de LLM e as GPUs que realmente executam o modelo. Vamos construir uma comunidade mais forte em torno de sistemas de IA práticos, escaláveis e do mundo real.
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.








