
Группа изучения: Вывод в ИИ системах
Описание
Группа изучения: Вывод LLM Присоединяйтесь к Примененному AI Коллективу для практической группы изучения по выводу LLM и vLLM — как современные языковые модели эффективно обслуживаются, что происходит после того, как запрос достигает модели, и как системы вывода балансируют задержку, пропускную способность, память и стоимость. Поскольку приложения LLM переходят от прототипов к реальным продуктам, эффективное выполнение модели становится важной частью стека ИИ. Недостаточно просто выбрать способную модель — разработчики также должны понимать, как эта модель разворачивается, как обрабатываются запросы, как используются ресурсы GPU и как производительность вывода изменяется по мере роста трафика. Эта сессия предназначена для дружеской дискуссии для инженеров, основателей, исследователей, разработчиков продуктов и энтузиастов ИИ, которые хотят лучше понять инфраструктуру обслуживания LLM в производственных условиях. Что мы будем обсуждать: • Что такое вывод LLM и что происходит во время обслуживания модели • Предварительная и декодирование и почему у них разные характеристики производительности • Задержка, пропускная способность, токены в секунду и другие важные метрики вывода • Как пакетирование и непрерывное пакетирование улучшают использование GPU • Кэширование KV и почему это важно для производительности вывода • Введение в vLLM и как он позволяет высокопропускное обслуживание LLM • PagedAttention и проблема, которую он был создан решить • Квантование и другие методы для снижения затрат на вывод и использования памяти • Обслуживание моделей с открытым исходным кодом и размышления о GPU, размере модели и одновременности • Открытая дискуссия о фреймворках вывода, архитектурах, бенчмарках и вызовах развертывания в реальном мире Who should attend: Строители ИИ, программисты, инженеры ML, основатели, менеджеры продуктов, исследователи, студенты и все, кто заинтересован в понимании того, как LLM обслуживаются в реальных системах. Предварительная экспертиза в инфраструктуре вывода не требуется. Приносите свои вопросы, опыты с инструментами, такими как vLLM, модели, которые вы развернули, или ИИ системы, которые вы сейчас строите. Это группа изучения, а не формальная лекция. Цель — учиться вместе, обсуждать практические подходы и построить лучшее понимание того, что происходит между приложением LLM и GPU, которые фактически выполняют модель. Давайте создадим более крепкое сообщество вокруг практических, масштабируемых, реальных систем ИИ.
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.
