
Grupa badawcza: Wnioskowanie w systemach AI
Opis
Grupa badawcza: Wnioskowanie LLM Dołącz do Zastosowanej AI Collective na praktyczną grupę badawczą na temat wnioskowania LLM i vLLM — jak nowoczesne modele językowe są efektywnie serwowane, co się dzieje po tym, jak polecenie dotrze do modelu oraz jak systemy wnioskowania równoważą opóźnienia, przepustowość, pamięć i koszty. W miarę jak aplikacje LLM przechodzą od prototypów do produktów rzeczywistych, efektywne uruchamianie modelu staje się ważną częścią stosu AI. Nie wystarczy wybrać zdolny model — twórcy muszą również zrozumieć, jak ten model jest wdrażany, jak przetwarzane są żądania, jak wykorzystywane są zasoby GPU i jak wydajność wnioskowania zmienia się w miarę wzrostu ruchu. Sesja ta została zaprojektowana jako przyjazna dla twórców dyskusja dla inżynierów, założycieli, badaczy, twórców produktów oraz entuzjastów AI, którzy chcą lepiej zrozumieć infrastrukturę stojącą za serwowaniem LLM w produkcji. O czym będziemy rozmawiać: • Czym jest wnioskowanie LLM i co się dzieje podczas serwowania modelu • Prefill vs. dekodowanie i dlaczego mają różne charakterystyki wydajności • Opóźnienie, przepustowość, liczba tokenów na sekundę i inne ważne metryki wnioskowania • Jak wsadowe przetwarzanie i ciągłe wsadowe przetwarzanie poprawiają wykorzystanie GPU • Cache KV i dlaczego ma to znaczenie dla wydajności wnioskowania • Wprowadzenie do vLLM i jak umożliwia ono serwowanie LLM o wysokiej przepustowości • PagedAttention i problem, który miał rozwiązać • Kwantyzacja i inne techniki redukcji kosztów wnioskowania oraz wykorzystania pamięci • Serwowanie modeli open-source i myślenie o GPU, rozmiarze modelu i równoczesności • Otwarte dyskusje na temat frameworków wnioskowania, architektur, benchmarków i wyzwań związanych z wdrażaniem w rzeczywistych systemach Kto powinien wziąć udział: Twórcy AI, inżynierowie oprogramowania, inżynierowie ML, założyciele, menedżerowie produktów, badacze, studenci oraz wszyscy, którzy są zainteresowani tym, jak LLM są serwowane w systemach rzeczywistych. Nie jest wymagane wcześniejsze doświadczenie w infrastrukturze wnioskowania. Przynieś swoje pytania, doświadczenia z narzędziami takimi jak vLLM, modele, które wdrożyłeś, lub systemy AI, które obecnie budujesz. To jest grupa badawcza, a nie formalny wykład. Celem jest wspólne uczenie się, omawianie praktycznych podejść i lepsze zrozumienie, co się dzieje pomiędzy aplikacją LLM a GPU, które rzeczywiście uruchamiają model. Zbudujmy silniejszą społeczność wokół praktycznych, skalowalnych, rzeczywistych systemów AI.
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.
