
Studiegroep: Inferentie in AI-systemen
Beschrijving
Studiegroep: LLM-inferentie. Sluit je aan bij de Applied AI Collective voor een praktische studiegroep over LLM-inferentie en vLLM — hoe moderne taalmodes efficiënt worden aangeboden, wat er gebeurt nadat een prompt een model bereikt en hoe inferentiesystemen latentie, doorvoer, geheugen en kosten in balans brengen. Terwijl LLM-toepassingen van prototypes naar echte producten gaan, wordt het efficiënt draaien van het model een belangrijk onderdeel van de AI-stack. Het is niet genoeg om een capabel model te kiezen — bouwers moeten ook begrijpen hoe dat model wordt ingezet, hoe verzoeken worden verwerkt, hoe GPU-hulpmiddelen worden gebruikt en hoe de inferentieprestaties veranderen naarmate het verkeer toeneemt. Deze sessie is ontworpen als een gesprek dat toegankelijk is voor bouwers, engineers, oprichters, onderzoekers, productbouwers en AI-enthousiastelingen die een beter begrip willen krijgen van de infrastructuur achter het aanbieden van LLMs in productie. Wat we zullen behandelen: • Wat LLM-inferentie is en wat er gebeurt tijdens het modelserveren • Prefill vs. decodering en waarom ze verschillende prestatiekenmerken hebben • Latentie, doorvoer, tokens per seconde en andere belangrijke inferentiestatistieken • Hoe batching en continue batching de GPU-utilisatie verbeteren • KV-caching en waarom het belangrijk is voor de inferentieprestaties • Een inleiding tot vLLM en hoe het hoge doorvoer LLM-serveren mogelijk maakt • PagedAttention en het probleem dat het is ontworpen om op te lossen • Kwantisatie en andere technieken om de inferentiekosten en het geheugengebruik te verlagen • Het aanbieden van open-source modellen en nadenken over GPU's, modelgrootte en gelijktijdigheid • Open discussie over inferentiekaders, architecturen, benchmarks en uitdagingen bij de implementatie in de echte wereld. Wie zou moeten deelnemen: AI-bouwers, software-ingenieurs, ML-ingenieurs, oprichters, productmanagers, onderzoekers, studenten en iedereen die geïnteresseerd is in het begrijpen van hoe LLMs worden aangeboden in echte systemen. Er is geen eerdere expertise in inferentie-infrastructuur vereist. Breng je vragen mee, ervaringen met tools zoals vLLM, modellen die je hebt geïmplementeerd, of AI-systemen die je momenteel bouwt. Dit is een studiegroep, geen formele lezing. Het doel is om samen te leren, praktische benaderingen te bespreken en een beter begrip op te bouwen van wat er gebeurt tussen een LLM-toepassing en de GPU's die daadwerkelijk het model draaien. Laten we een sterkere gemeenschap opbouwen rond praktische, schaalbare, real-world AI-systemen.
Laat je netwerk weten dat je komt
Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.
