
Grupo de Estudo: Inferência em Sistemas de IA
Descrição
Grupo de Estudo: Inferência em LLM Junte-se ao Coletivo de IA Aplicada para um grupo de estudo prático sobre inferência em LLM e vLLM — como os modernos modelos de linguagem são servidos de forma eficiente, o que acontece após um prompt chegar a um modelo, e como os sistemas de inferência equilibram latência, throughput, memória e custo. À medida que as aplicações de LLM evoluem de protótipos para produtos do mundo real, executar o modelo de forma eficiente torna-se uma parte importante da pilha de IA. Não é suficiente escolher um modelo capaz — os construtores também precisam entender como esse modelo é implantado, como as solicitações são processadas, como os recursos da GPU são utilizados e como o desempenho da inferência muda conforme o tráfego cresce. Esta sessão é projetada como uma discussão amigável para construtores, engenheiros, fundadores, pesquisadores, construtores de produtos e entusiastas de IA que desejam entender melhor a infraestrutura por trás do atendimento de LLMs em produção. O que abordaremos: • O que é inferência em LLM e o que acontece durante o atendimento do modelo • Prefill vs. decodificação e por que eles têm características de desempenho diferentes • Latência, throughput, tokens por segundo e outras métricas importantes de inferência • Como o batching e o batching contínuo melhoram a utilização da GPU • KV caching e por que isso é importante para o desempenho da inferência • Uma introdução ao vLLM e como ele possibilita o atendimento de LLMs de alto throughput • PagedAttention e o problema que foi projetado para resolver • Quantização e outras técnicas para reduzir o custo e o uso de memória da inferência • Atendimento de modelos de código aberto e pensando em GPUs, tamanho do modelo e concorrência • Discussão aberta sobre frameworks de inferência, arquiteturas, benchmarks e desafios de implantação no mundo real Quem deve participar: Construtores de IA, engenheiros de software, engenheiros de ML, fundadores, gerentes de produtos, pesquisadores, estudantes e qualquer pessoa interessada em entender como os LLMs são atendidos em sistemas do mundo real. Nenhuma experiência prévia em infraestrutura de inferência é necessária. Traga suas perguntas, experiências com ferramentas como vLLM, modelos que você implantou ou sistemas de IA que você está construindo atualmente. Este é um grupo de estudo, não uma palestra formal. O objetivo é aprender juntos, discutir abordagens práticas e construir uma melhor compreensão do que acontece entre uma aplicação de LLM e as GPUs que realmente executam o modelo. Vamos construir uma comunidade mais forte em torno de sistemas de IA práticos, escaláveis e do mundo real.
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.
