Enviar evento
Grupo de Estudio: Inferencia en Sistemas de IA

Grupo de Estudio: Inferencia en Sistemas de IA

29 sep. 20266:00 PM GMT-07:00En líneaOpen
LearnNetworkFind partners
TextCode

Descripción

Grupo de Estudio: Inferencia de LLM Únete al Colectivo de IA Aplicada para un grupo de estudio práctico sobre la inferencia de LLM y vLLM: cómo los modelos de lenguaje modernos se sirven de manera eficiente, qué sucede después de que un prompt llega a un modelo y cómo los sistemas de inferencia equilibran la latencia, el rendimiento, la memoria y el costo. A medida que las aplicaciones de LLM pasan de prototipos a productos del mundo real, ejecutar el modelo de manera eficiente se convierte en una parte importante de la pila de IA. No es suficiente elegir un modelo capaz; los creadores también deben entender cómo se implementa ese modelo, cómo se procesan las solicitudes, cómo se utilizan los recursos de GPU y cómo cambia el rendimiento de la inferencia a medida que crece el tráfico. Esta sesión está diseñada como una discusión amigable para constructores, ingenieros, fundadores, investigadores, creadores de productos y entusiastas de la IA que desean comprender mejor la infraestructura detrás de la servición de LLM en producción. Lo que cubriremos: • Qué es la inferencia de LLM y qué sucede durante la servición del modelo • Prefill vs. decodificación y por qué tienen diferentes características de rendimiento • Latencia, rendimiento, tokens por segundo y otras métricas importantes de inferencia • Cómo el batching y el batching continuo mejoran la utilización de GPU • Cacheo de KV y por qué es importante para el rendimiento de la inferencia • Una introducción a vLLM y cómo permite la servición de LLM de alto rendimiento • PagedAttention y el problema que fue diseñado para resolver • Cuantificación y otras técnicas para reducir el costo de inferencia y el uso de memoria • Servir modelos de código abierto y pensar en las GPUs, el tamaño del modelo y la concurrencia • Discusión abierta sobre marcos de inferencia, arquitecturas, puntos de referencia y desafíos de implementación en el mundo real. Quién debe asistir: constructores de IA, ingenieros de software, ingenieros de ML, fundadores, gerentes de producto, investigadores, estudiantes y cualquier persona interesada en comprender cómo se sirven los LLM en sistemas del mundo real. No se requiere experiencia previa en infraestructura de inferencia. Trae tus preguntas, experiencias con herramientas como vLLM, modelos que hayas implementado o sistemas de IA que estés construyendo actualmente. Este es un grupo de estudio, no una conferencia formal. El objetivo es aprender juntos, discutir enfoques prácticos y construir una mejor comprensión de lo que sucede entre una aplicación de LLM y las GPUs que realmente ejecutan el modelo. Construyamos una comunidad más fuerte en torno a sistemas de IA prácticos, escalables y del mundo real.

Dile a tu red que vas a ir

Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.

Eventos relacionados

Plataforma de inteligencia artificial

Precios en el sitio web
Obtener entradas