
vLLM Inference Meetup Mumbai
Beschreibung
Ein technisches Treffen zu vLLM und llm-d am 26. September 2026, das skalierbare LLM-Inferenz durch Architektur-Tiefenanalysen, Produktionslektionen und Live-Demos erkundet. ## Innenleben des LLM-Inferenz-Engines Entwickelt für Ingenieure, die generative KI-Systeme schneller und effizienter betreiben möchten, geht das vLLM Inference Meetup Mumbai über hochrangige Diskussionen hinaus, um die Ingenieurskunst hinter Inferenz in großem Maßstab zu untersuchen. Das Programm konzentriert sich auf Architektur- und Optimierungstechniken, die Teams helfen, die GPU-Infrastruktur besser zu nutzen, den Token-Durchsatz zu erhöhen und LLM-Dienste in die Produktion zu bringen. Die Teilnehmer hören direkt von den Wartenden und Kernbeiträgen, die in den vLLM und llm-d Ökosystemen arbeiten, sowie von Branchenpraktikern mit Erfahrungen in der Bereitstellung von Produktions-KI-Systemen. Die Sitzungen kombinieren Projektupdates und technische Vorträge mit praktischen Demonstrationen von Arbeitsabläufen aus der realen Welt. ## Höhepunkte der Agenda Das geplante Programm umfasst: - Eine Einführung in vLLM und ein Update zu den neuesten Entwicklungen des Projekts - Spekulative Dekodierung und ihre Rolle bei der Beschleunigung der KI-Inferenz - Eine Reise von der Evaluation zur Produktion, einschließlich wie man einen verwalteten vLLM-Dienst mit llm-d aufbaut - Lektionen von Teams, die LLMs in der Produktion bereitstellen und bedienen - Ein hands-on Labor von Sardeenz, das die GPU-Virtualisierung und den Einsatz mehrerer Modelle auf einer einzigen GPU abdeckt - Live-Demos, ein Eröffnungsstatement und Möglichkeiten, Ideen mit Referenten und anderen Ingenieuren auszutauschen Die Agenda kann Änderungen unterliegen, um Platz für weitere technische Inhalte und Gemeinschaftsbeiträge zu lassen. ## Wer sollte teilnehmen? Dieses Meetup ist besonders relevant für vLLM- und llm-d-Nutzer oder -Beiträger, Maschinenlern- und Infrastruktur-Ingenieure, die für Inferenz und Modellbereitstellung verantwortlich sind, sowie für Plattformteams, die GenAI-Arbeitslasten in der Produktion betreiben. Es wird auch Entwicklern entsprechen, die eine effiziente Inferenz in lokalen Umgebungen, Cloud-Infrastrukturen und Kubernetes untersuchen möchten.… Registrieren Sie sich für diese Veranstaltung
Tools, die bei der Veranstaltung verwendet werden
vLLM
llm-d
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.