
Studiengruppe: Inferenz in KI-Systemen
Beschreibung
Studiengruppe: LLM-Inferenz. Treten Sie der Applied AI Collective bei für eine praktische Studiengruppe zur LLM-Inferenz und vLLM – wie moderne Sprachmodelle effizient bereitgestellt werden, was passiert, nachdem ein Prompt ein Modell erreicht, und wie Inferenzsysteme Latenz, Durchsatz, Speicher und Kosten ausbalancieren. Während LLM-Anwendungen von Prototypen zu realen Produkten übergehen, wird die effiziente Ausführung des Modells zu einem wichtigen Bestandteil des KI-Stacks. Es reicht nicht aus, ein leistungsfähiges Modell auszuwählen – Entwickler müssen auch verstehen, wie dieses Modell bereitgestellt wird, wie Anfragen verarbeitet werden, wie GPU-Ressourcen genutzt werden und wie die Inferenzleistung mit wachsendem Datenaufkommen variiert. Diese Sitzung ist als entwicklungfreundliche Diskussion für Ingenieure, Gründer, Forscher, Produktentwickler und KI-Enthusiasten gedacht, die ein besseres Verständnis für die Infrastruktur hinter der Bereitstellung von LLMs in der Produktion gewinnen möchten. Was wir behandeln werden: • Was LLM-Inferenz ist und was während des Modellbetriebs passiert • Prefill vs. Decoding und warum sie unterschiedliche Leistungsmerkmale aufweisen • Latenz, Durchsatz, Token pro Sekunde und andere wichtige Inferenzkennzahlen • Wie Batching und kontinuierliches Batching die GPU-Nutzung verbessern • KV-Caching und warum es für die Inferenzleistung wichtig ist • Eine Einführung in vLLM und wie es hoch throughput LLM-Bereitstellung ermöglicht • PagedAttention und das Problem, das es lösen sollte • Quantisierung und andere Techniken zur Reduzierung der Inferenzkosten und des Speicherbedarfs • Bereitstellung von Open-Source-Modellen und Überlegungen zu GPUs, Modellgröße und Parallelität • Offene Diskussion zu Inferenz-Frameworks, Architekturen, Benchmarks und Herausforderungen bei der realen Bereitstellung. Wer teilnehmen sollte: KI-Entwickler, Software-Ingenieure, ML-Ingenieure, Gründer, Produktmanager, Forscher, Studenten und alle, die daran interessiert sind zu verstehen, wie LLMs in realen Systemen bereitgestellt werden. Es sind keine Vorkenntnisse in Inferenz-Infrastruktur erforderlich. Bringen Sie Ihre Fragen, Erfahrungen mit Tools wie vLLM, Modelle, die Sie bereitgestellt haben, oder KI-Systeme, die Sie gerade entwickeln. Dies ist eine Studiengruppe, keine formelle Vorlesung. Das Ziel ist, gemeinsam zu lernen, praktische Ansätze zu diskutieren und ein besseres Verständnis dafür zu entwickeln, was zwischen einer LLM-Anwendung und den GPUs, die das Modell tatsächlich ausführen, passiert. Lassen Sie uns eine stärkere Gemeinschaft rund um praktische, skalierbare, realistische KI-Systeme aufbauen.
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.






