Evenement toevoegen
Studiegroep: Inferentie in AI-systemen

Studiegroep: Inferentie in AI-systemen

29 sep. 20266:00 PM GMT-07:00OnlineOpen
LearnNetworkFind partners
TextCode

Beschrijving

Studiegroep: LLM Inferentie Sluit je aan bij de Toegepaste AI Collectief voor een praktische studiegroep over LLM-inferentie en vLLM — hoe moderne taalkundige modellen efficiënt worden aangeboden, wat er gebeurt nadat een prompt een model bereikt, en hoe inferentiesystemen latency, doorvoer, geheugen en kosten in balans brengen. Nu LLM-toepassingen van prototypes naar echte producten bewegen, wordt het efficiënt draaien van het model een belangrijk onderdeel van de AI-stack. Het is niet voldoende om een capabel model te kiezen — bouwers moeten ook begrijpen hoe dat model wordt ingezet, hoe verzoeken worden verwerkt, hoe GPU-resources worden gebruikt en hoe de prestatie van inferentie verandert naarmate het verkeer toeneemt. Deze sessie is ontworpen als een bouwersvriendelijke discussie voor ingenieurs, oprichters, onderzoekers, productbouwers en AI-enthousiastelingen die een beter begrip willen krijgen van de infrastructuur achter het aanbieden van LLM's in productie. Wat we zullen behandelen: • Wat LLM-inferentie is en wat er gebeurt tijdens het aanbieden van een model • Prefill versus decodering en waarom ze verschillende prestatiekenmerken hebben • Latency, doorvoer, tokens per seconde en andere belangrijke inferentiestatistieken • Hoe batching en continue batching de GPU-utilisatie verbeteren • KV-caching en waarom het belangrijk is voor de prestatie van inferentie • Een inleiding tot vLLM en hoe het hoge doorvoer voor LLM-diensten mogelijk maakt • PagedAttention en het probleem dat het is ontworpen om op te lossen • Kwantisatie en andere technieken voor het verminderen van de kosten en het geheugengebruik van inferentie • Het aanbieden van open-source modellen en denken over GPU's, modelgrootte en gelijktijdigheid • Open discussie over inferentiekaders, architecturen, benchmarks en uitdagingen bij het implementeren in de echte wereld Wie moet bijwonen: AI-bouwers, software-ingenieurs, ML-ingenieurs, oprichters, productmanagers, onderzoekers, studenten en iedereen die geïnteresseerd is in het begrijpen van hoe LLM's worden bediend in echte systemen. Geen eerdere expertise in inferentie-infrastructuur is vereist. Breng je vragen, ervaringen met tools zoals vLLM, modellen die je hebt ingezet, of AI-systemen die je momenteel aan het bouwen bent. Dit is een studiegroep, geen formele lezing. Het doel is om samen te leren, praktische benaderingen te bespreken en een beter begrip op te bouwen van wat er gebeurt tussen een LLM-toepassing en de GPU's die daadwerkelijk het model draaien. Laten we een sterkere gemeenschap rondom praktische, schaalbare, echte AI-systemen opbouwen.

Laat je netwerk weten dat je komt

Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.

Gerelateerde evenementen

Platform voor kunstmatige intelligentie

Prijzen op de website
Tickets kopen