
Grupo de Estudio: Inferencia en Sistemas de IA
Descripción
Grupo de Estudio: Inferencia de LLM Únete al Colectivo de IA Aplicada para un grupo de estudio práctico sobre la inferencia de LLM y vLLM — cómo se sirven de manera eficiente los modernos modelos de lenguaje, qué sucede después de que un aviso llega a un modelo, y cómo los sistemas de inferencia equilibran latencia, rendimiento, memoria y costo. A medida que las aplicaciones de LLM pasan de ser prototipos a productos del mundo real, ejecutar el modelo de manera eficiente se convierte en una parte importante de la pila de IA. No es suficiente elegir un modelo capaz: los constructores también necesitan entender cómo se despliega ese modelo, cómo se procesan las solicitudes, cómo se utilizan los recursos de GPU y cómo el rendimiento de la inferencia cambia a medida que el tráfico crece. Esta sesión está diseñada como una discusión amigable para constructores dirigida a ingenieros, fundadores, investigadores, creadores de productos y entusiastas de la IA que desean comprender mejor la infraestructura detrás de la prestación de LLM en producción. Lo que cubriremos: • Qué es la inferencia de LLM y qué sucede durante la prestación del modelo • Prefill vs. decodificación y por qué tienen diferentes características de rendimiento • Latencia, rendimiento, tokens por segundo y otras métricas importantes de inferencia • Cómo el agrupamiento y el agrupamiento continuo mejoran la utilización de GPU • Caching de KV y por qué es importante para el rendimiento de la inferencia • Una introducción a vLLM y cómo permite la prestación de LLM de alto rendimiento • PagedAttention y el problema que fue diseñado para resolver • Cuantización y otras técnicas para reducir el costo de inferencia y el uso de memoria • Prestación de modelos de código abierto y pensar en GPUs, tamaño del modelo y concurrencia • Discusión abierta sobre marcos de inferencia, arquitecturas, benchmarks y desafíos de despliegue en el mundo real ¿Quién debe asistir?: Constructores de IA, ingenieros de software, ingenieros de ML, fundadores, gerentes de producto, investigadores, estudiantes y cualquier persona interesada en entender cómo se sirven los LLM en sistemas del mundo real. No se requiere experiencia previa en infraestructura de inferencia. Trae tus preguntas, experiencias con herramientas como vLLM, modelos que has desplegado o sistemas de IA que estás construyendo actualmente. Este es un grupo de estudio, no una conferencia formal. El objetivo es aprender juntos, discutir enfoques prácticos y construir un mejor entendimiento de lo que sucede entre una aplicación de LLM y las GPUs que realmente ejecutan el modelo. Construyamos una comunidad más fuerte en torno a sistemas de IA prácticos, escalables y del mundo real.
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.
