
Група для вивчення: Висновки в АІ системах
Опис
Група для вивчення: Висновки LLM Приєднуйтеся до Застосованого АІ Колективу для практичної групи для вивчення висновків LLM та vLLM — як сучасні мовні моделі ефективно надаються, що відбувається після того, як запит потрапляє до моделі, і як системи висновків врівноважують затримку, пропускну здатність, пам’ять і витрати. Оскільки застосування LLM переходять від прототипів до реальних продуктів, ефективне виконання моделі стає важливою частиною АІ стеку. Недостатньо вибрати спроможну модель — розробники також повинні розуміти, як ця модель розгортається, як опрацьовуються запити, як використовуються ресурси GPU та як продуктивність висновків змінюється в міру зростання трафіку. Ця сесія розроблена як дискусія для розробників, засновників, дослідників, продуктів і ентузіастів АІ, які хочуть краще зрозуміти інфраструктуру, яка стоїть за наданням LLM в продукції. Що ми покриємо: • Що таке висновки LLM і що відбувається під час обслуговування моделі • Попереднє заповнення проти декодування та чому вони мають різні характеристики продуктивності • Затримка, пропускна здатність, токени за секунду та інші важливі метрики висновків • Як групування та безперервне групування покращують використання GPU • Кешування KV та чому це важливо для продуктивності висновків • Вступ до vLLM і як він дозволяє високе обслуговування LLM • PagedAttention і проблема, яку він був задуманий вирішувати • Квантизація та інші техніки для зниження витрат на висновки та використання пам’яті • Обслуговування моделей з відкритим кодом і думки про GPU, розмір моделей і одночасність • Відкрита дискусія про фреймворки висновків, архітектури, бенчмарки та проблеми реального розгортання. Хто повинен відвідувати: АІ розробники, програмні інженери, інженери з машинного навчання, засновники, менеджери продуктів, дослідники, студенти та всі, хто цікавиться розумінням того, як LLM надаються в реальних системах. Попередній досвід в інфраструктурі висновків не потрібен. Принесіть свої запитання, досвід з інструментами, такими як vLLM, моделі, які ви розгорнули, або АІ системи, які ви зараз будуєте. Це група для вивчення, а не формальна лекція. Мета — вчитися разом, обговорювати практичні підходи та створити краще розуміння того, що відбувається між застосуванням LLM і GPU, які фактично виконують модель. Давайте побудуємо сильнішу спільноту навколо практичних, масштабованих реальних АІ систем.
Розкажіть своїй мережі, що ви йдете
Поділіться цією подією, щоб розпочати розмови, запросити колег та налагодити контакти до її початку.
