
#39 - Modeloptimalisatie & CPU-gebaseerde inferentie
Beschrijving
Geweldig!!! Meetup #39 vindt plaats op 24 september bij AI Sweden en richt zich op "Modeloptimalisatie & CPU-gebaseerde inferentie". We zijn super enthousiast om samen te werken met Spaanse Quantum AI-tovenaars van Multiverse Computing en techgiganten Intel en HPE. Het programma wordt momenteel uitgewerkt, dus houd je planken in de gaten voor updates! Er gebeurt een enorme hoeveelheid op het gebied van modeloptimalisatie en inferentie. Nieuwe benaderingen lijken dagelijks aangekondigd te worden, zoals het mogelijk maken om het onlangs vrijgegeven 2,78 biljoen parameter model Kimi K3 op een enkele CPU met 8GB geheugen te draaien...!!! of de aankondiging van Multiverse Computing op 23 juli dat al hun gecomprimeerde modellen nu draaien op Intel Xeon 6-processors. Dus maak je vast en bereid je voor op impact! Evenementprogramma- Deuren openen om 17:00 CET- Lezingen beginnen om 17:45 CET- Er zullen pizza's & drankjes zijn- Er kan een gemodereerde Q&A-sessie zijn.... Sprekerslijn-up TBD... - Franco Serra, Solutions Architect bij Multiverse Computing, zal een presentatie geven met de titel "Ultra Efficiënte Modellen om je GenAI Datacenter te Schalen & Geschikt voor implementatie op de rand". Abstract: Terwijl organisaties racen om Generatieve AI uit te rollen, domineren twee uitdagingen: hoe de inferentie economisch op te schalen in het datacenter, en hoe intelligentie naar de rand te brengen waar connectiviteit, vermogen en voetafdruk beperkt zijn. Multiverse Computing maakt ultra-efficiënte, gecomprimeerde AI-modellen, waaronder LLM's, VLM's, spraak-naar-tekst, en computer vision-modellen — ontworpen om dezelfde nauwkeurigheid te leveren met een fractie van de geheugeneisen. Door te integreren met Intel®-hardware, kunnen bedrijven grotere AI-modellen op bestaande infrastructuur implementeren in plaats van deze uit te breiden. In het datacenter vertalen slankere modellen zich direct in hogere doorvoer, lager energieverbruik en verbeterde ROI door meer gebruikers en workloads op dezelfde infrastructuur mogelijk te maken. Aan de rand maken dezelfde compressie-doorbraken het mogelijk om GenAI in beperkte omgevingen uit te rollen — waardoor veilige, lage-latentie AI naar tactische omgevingen wordt gebracht. - Thomas Melzer, Senior Solutions Architect bij Intel, zal een presentatie geven over de herleving van de relevantie van CPU's voor inferentie.... - Johan Fondin, Solutions Architect bij HPE, zal een presentatie geven over de dynamiek van opslag, streamen en geheugen... We kijken ernaar uit je daar te zien, /Patrick & het Stockholm MLOps Team
Locatie evenement
Laat je netwerk weten dat je komt
Deel dit evenement om gesprekken te starten, collega`s uit te nodigen en van tevoren contact te leggen.