
Studiengruppe: Inferenz in KI-Systemen
Beschreibung
Studiengruppe: LLM-Inferenz Treten Sie der Applied AI Collective bei für eine praktische Studiengruppe zur LLM-Inferenz und vLLM – wie moderne Sprachmodelle effizient bereitgestellt werden, was passiert, nachdem ein Prompt ein Modell erreicht, und wie Inferenzsysteme Latenz, Durchsatz, Speicher und Kosten ausbalancieren. Da LLM-Anwendungen von Prototypen zu realen Produkten übergehen, wird der effiziente Betrieb des Modells zu einem wichtigen Bestandteil des KI-Stacks. Es reicht nicht aus, ein fähiges Modell auszuwählen – Entwickler müssen auch verstehen, wie dieses Modell bereitgestellt wird, wie Anfragen verarbeitet werden, wie GPU-Ressourcen genutzt werden und wie sich die Inferenzleistung bei steigendem Traffic verändert. Diese Sitzung ist als builder-freundliche Diskussion für Ingenieure, Gründer, Forscher, Produktentwickler und KI-Enthusiasten konzipiert, die das besser verstehen möchten, was die Infrastruktur hinter der Bereitstellung von LLMs in der Produktion betrifft. Was wir behandeln werden: • Was LLM-Inferenz ist und was während der Modellbereitstellung passiert • Prefill vs. Decoding und warum sie unterschiedliche Leistungsmerkmale aufweisen • Latenz, Durchsatz, Token pro Sekunde und andere wichtige Inferenzmetriken • Wie Batching und kontinuierliches Batching die GPU-Auslastung verbessern • KV-Caching und warum es für die Inferenzleistung wichtig ist • Eine Einführung in vLLM und wie es eine hochdurchsatzfähige LLM-Bereitstellung ermöglicht • PagedAttention und das Problem, das es zu lösen entworfen wurde • Quantisierung und andere Techniken zur Reduzierung der Inferenzkosten und des Speicherverbrauchs • Bereitstellung von Open-Source-Modellen und Überlegungen zu GPUs, Modellgröße und Parallelität • Offene Diskussion über Inferenz-Frameworks, Architekturen, Benchmarks und Herausforderungen bei der realen Bereitstellung Wer teilnehmen sollte: KI-Entwickler, Software-Ingenieure, ML-Ingenieure, Gründer, Produktmanager, Forscher, Studenten und alle, die daran interessiert sind zu verstehen, wie LLMs in realen Systemen bereitgestellt werden. Es sind keine vorherigen Fachkenntnisse über Inferenzinfrastrukturen erforderlich. Bringen Sie Ihre Fragen, Erfahrungen mit Tools wie vLLM, Modelle, die Sie bereitgestellt haben, oder KI-Systeme, die Sie derzeit entwickeln. Dies ist eine Studiengruppe, keine formale Vorlesung. Das Ziel ist es, gemeinsam zu lernen, praktische Ansätze zu diskutieren und ein besseres Verständnis dafür aufzubauen, was zwischen einer LLM-Anwendung und den GPUs passiert, die das Modell tatsächlich ausführen. Lassen Sie uns eine stärkere Gemeinschaft rund um praktische, skalierbare, reale KI-Systeme aufbauen.
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.
