
Groupe d'étude : Inférence dans les systèmes d'IA
Description
Groupe d'étude : Inférence LLM Rejoignez le collectif d'IA appliquée pour un groupe d'étude pratique sur l'inférence LLM et vLLM — comment les modèles de langage modernes sont servis de manière efficace, ce qui se passe après qu'une invite atteigne un modèle, et comment les systèmes d'inférence équilibrent latence, débit, mémoire et coût. Alors que les applications LLM passent de prototypes à des produits réels, faire fonctionner le modèle efficacement devient une partie importante de la pile IA. Il ne suffit pas de choisir un modèle capable — les créateurs doivent également comprendre comment ce modèle est déployé, comment les demandes sont traitées, comment les ressources GPU sont utilisées et comment la performance de l'inférence change à mesure que le trafic croît. Cette session est conçue comme une discussion conviviale pour les ingénieurs, fondateurs, chercheurs, constructeurs de produits et passionnés d'IA qui souhaitent mieux comprendre l'infrastructure derrière le service des LLM en production. Ce que nous allons aborder : • Qu'est-ce que l'inférence LLM et que se passe-t-il lors du service de modèle • Pré-remplissage vs. décodage et pourquoi ils ont des caractéristiques de performance différentes • Latence, débit, jetons par seconde, et autres métriques d'inférence importantes • Comment le lotissement et le lotissement continu améliorent l'utilisation du GPU • Mise en cache KV et pourquoi cela importe pour la performance d'inférence • Une introduction à vLLM et comment cela permet un service LLM à haut débit • PagedAttention et le problème pour lequel il a été conçu • Quantification et autres techniques pour réduire les coûts d'inférence et l'utilisation de la mémoire • Service de modèles open-source et réflexion sur les GPU, la taille des modèles et la concurrence • Discussion ouverte sur les frameworks d'inférence, architectures, benchmarks et défis de déploiement dans le monde réel Qui devrait assister : Créateurs d'IA, ingénieurs logiciels, ingénieurs ML, fondateurs, chefs de produit, chercheurs, étudiants et toute personne intéressée à comprendre comment les LLM sont servis dans des systèmes d'application réels. Aucune expertise préalable en infrastructure d'inférence n'est requise. Apportez vos questions, vos expériences avec des outils comme vLLM, les modèles que vous avez déployés ou les systèmes d'IA que vous construisez actuellement. C'est un groupe d'étude, pas un cours formel. L'objectif est d'apprendre ensemble, de discuter d'approches pratiques et de construire une meilleure compréhension de ce qui se passe entre une application LLM et les GPU qui exécutent réellement le modèle. Construisons une communauté plus forte autour de systèmes IA pratiques, évolutifs et du monde réel.
Faites savoir à votre réseau que vous y allez
Partagez cet événement pour engager des conversations, inviter des collègues et vous connecter avant qu`il commence.
