
Grupa badawcza: Wnioskowanie w systemach AI
Opis
Grupa badawcza: Wnioskowanie LLM Dołącz do Applied AI Collective na praktyczną grupę badawczą poświęconą wnioskowaniu LLM i vLLM — jak nowoczesne modele językowe są wydajnie serwowane, co się dzieje po tym, jak podpowiedź dotrze do modelu, oraz jak systemy wnioskowania równoważą latencję, przepustowość, pamięć i koszty. Gdy aplikacje LLM przechodzą z prototypów do produktów rzeczywistych, efektywne uruchomienie modelu staje się ważną częścią stosu AI. Wybór zdolnego modelu to za mało — twórcy muszą również rozumieć, jak ten model jest wdrażany, jak przetwarzane są żądania, jak używane są zasoby GPU oraz jak wydajność wnioskowania zmienia się w miarę wzrostu ruchu. Ta sesja jest zaprojektowana jako przyjazna dla budowniczych dyskusja dla inżynierów, założycieli, badaczy, twórców produktów i entuzjastów AI, którzy chcą lepiej zrozumieć infrastrukturę stojącą za serwowaniem LLM w produkcji. Co omówimy: • Co to jest wnioskowanie LLM i co się dzieje podczas serwowania modelu • Prefill vs. dekodowanie i dlaczego mają różne charakterystyki wydajności • Latencja, przepustowość, tokeny na sekundę i inne ważne metryki wnioskowania • Jak batching i ciągły batching poprawiają wykorzystanie GPU • KV caching i dlaczego ma to znaczenie dla wydajności wnioskowania • Wprowadzenie do vLLM i jak umożliwia ono serwowanie LLM o wysokiej przepustowości • PagedAttention i problem, który został zaprojektowany do rozwiązania • Kwantyzacja i inne techniki zmniejszania kosztów wnioskowania i użycia pamięci • Serwowanie modeli open-source oraz myślenie o GPU, rozmiarze modelu i współbieżności • Otwana dyskusja na temat frameworków wnioskowania, architektur, benchmarków i wyzwań z rzeczywistego wdrożenia Kto powinien wziąć udział: twórcy AI, inżynierowie oprogramowania, inżynierowie ML, założyciele, menedżerowie produktów, badacze, studenci i każdy, kto chce zrozumieć, jak LLM są serwowane w systemach rzeczywistych. Nie jest wymagana wcześniejsza wiedza na temat infrastruktury wnioskowania. Przyjdź ze swoimi pytaniami, doświadczeniami z narzędziami takimi jak vLLM, modelami, które wdrożyłeś, lub systemami AI, które aktualnie budujesz. To jest grupa badawcza, nie formalny wykład. Celem jest uczenie się razem, omawianie praktycznych podejść i budowanie lepszego zrozumienia tego, co się dzieje między aplikacją LLM a GPU faktycznie uruchamiającymi model. Stwórzmy silniejszą społeczność wokół praktycznych, skalowalnych, rzeczywistych systemów AI.
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.






