
Группа изучения: Вывод в AI системах
Описание
Группа изучения: Вывод LLM Присоединяйтесь к Применяемому AI Коллективу для практической группы изучения вывода LLM и vLLM — как современные языковые модели эффективно обслуживаются, что происходит после того, как запрос достигает модели, и как системы вывода балансируют задержку, пропускную способность, память и стоимость. Поскольку приложения LLM переходят от прототипов к реальным продуктам, эффективное использование модели становится важной частью AI стека. Выбрать способную модель недостаточно — создателям также необходимо понять, как эта модель развернута, как обрабатываются запросы, как используются ресурсы GPU и как производительность вывода меняется по мере увеличения трафика. Эта сессия предназначена для обсуждения, удобного для строителей, для инженеров, основателей, исследователей, создателей продуктов и энтузиастов AI, которые хотят лучше понять инфраструктуру за обслуживанием LLM в производстве. Что мы обсудим: • Что такое вывод LLM и что происходит во время обслуживания модели • Предварительная выборка против декодирования и почему у них разные характеристики производительности • Задержка, пропускная способность, токены в секунду и другие важные метрики вывода • Как пакетная обработка и непрерывная пакетная обработка улучшают использование GPU • Кэширование KV и почему это важно для производительности вывода • Введение в vLLM и как он позволяет высокопроизводительное обслуживание LLM • Пагинированное внимание и проблема, которую он был разработан для решения • Квантизация и другие техники для снижения стоимости вывода и использования памяти • Обслуживание моделей с открытым исходным кодом и размышления о GPU, размере модели и конкурентности • Открытое обсуждение вокруг фреймворков вывода, архитектур, бенчмарков и реальных проблем развертывания. Кто должен присутствовать: создатели AI, инженеры-программисты, инженеры ML, основатели, менеджеры продуктов, исследователи, студенты и все, кто интересуется тем, как LLM обслуживаются в реальных системах. Предварительная экспертиза в инфраструктуре вывода не требуется. Приносите свои вопросы, опыты с инструментами вроде vLLM, модели, которые вы развернули, или AI системы, которые вы сейчас создаете. Это группа изучения, а не формальная лекция. Цель состоит в том, чтобы изучать вместе, обсуждать практические подходы и построить лучшее понимание того, что происходит между приложением LLM и GPU, фактически выполняющими модель. Давайте создадим сильное сообщество вокруг практических, масштабируемых AI систем реального мира.
Расскажите своей сети, что вы идёте
Поделитесь этим событием, чтобы начать разговоры, пригласить коллег и наладить контакты до его начала.








