
Groupe d'étude : Inférence dans les systèmes IA
Description
Groupe d'étude : Inférence LLM Rejoignez le Collectif AI Appliqué pour un groupe d'étude pratique sur l'inférence LLM et vLLM — comment les modèles de langage modernes sont servis efficacement, ce qui se passe après qu'un prompt atteigne un modèle, et comment les systèmes d'inférence équilibrent latence, débit, mémoire et coût. À mesure que les applications LLM passent de prototypes à des produits réels, faire fonctionner le modèle efficacement devient une partie importante de la pile IA. Il ne suffit pas de choisir un modèle capable — les constructeurs doivent aussi comprendre comment ce modèle est déployé, comment les demandes sont traitées, comment les ressources GPU sont utilisées, et comment la performance d'inférence varie avec l'augmentation du trafic. Cette session est conçue comme une discussion amicale pour les ingénieurs, fondateurs, chercheurs, constructeurs de produits, et passionnés d'IA qui souhaitent mieux comprendre l'infrastructure derrière le service des LLM en production. Ce que nous allons couvrir : • Ce qu'est l'inférence LLM et ce qui se passe pendant le service du modèle • Pré-remplissage vs. décodage et pourquoi ils ont des caractéristiques de performance différentes • Latence, débit, tokens par seconde, et d'autres métriques d'inférence importantes • Comment le batching et le batching continu améliorent l'utilisation des GPU • Mise en cache KV et pourquoi c'est important pour la performance d'inférence • Une introduction à vLLM et comment cela permet un service LLM à haut débit • PagedAttention et le problème qu'il a été conçu pour résoudre • Quantification et autres techniques pour réduire le coût et l'utilisation de la mémoire d'inférence • Service de modèles open source et réflexion sur les GPU, la taille des modèles et la concurrence • Discussion ouverte autour des frameworks d'inférence, des architectures, des benchmarks, et des défis de déploiement dans le monde réel. Qui devrait assister : Constructeurs IA, ingénieurs logiciels, ingénieurs ML, fondateurs, chefs de produit, chercheurs, étudiants, et toute personne intéressée par la compréhension du service des LLM dans des systèmes réels. Aucune expertise préalable en infrastructure d'inférence n'est requise. Apportez vos questions, vos expériences avec des outils comme vLLM, des modèles que vous avez déployés, ou des systèmes d'IA que vous construisez actuellement. C'est un groupe d'étude, pas un cours formel. L'objectif est d'apprendre ensemble, de discuter d'approches pratiques, et de mieux comprendre ce qui se passe entre une application LLM et les GPU qui exécutent réellement le modèle. Construisons une communauté plus forte autour de systèmes IA pratiques, extensibles et réels.
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.








