
#39 - Optimización de Modelos y Inferencia Basada en CPU
Descripción
¡Muy bien!!! El Meetup #39 tendrá lugar el 24 de septiembre en AI Sweden y se centrará en "Optimización de Modelos y Inferencia Basada en CPU". Estamos muy emocionados de colaborar con los magos españoles de la IA Cuántica, Multiverse Computing, y los gigantes tecnológicos Intel y HPE. Actualmente, se está trabajando en el programa, así que mantente atento a las actualizaciones! Hay una cantidad tremenda de cosas sucediendo en el área de optimización de modelos e inferencia. Se están anunciando enfoques novedosos a diario, como la posibilidad de ejecutar el modelo de 2.78 billones de parámetros, Kimi K3, en una sola CPU con 8GB de memoria...!!! o el anuncio del 23 de julio de Multiverse Computing de que todos sus modelos comprimidos ahora funcionan en procesadores Intel Xeon 6. Así que prepárate y abróchate el cinturón! Programa del Evento- Las puertas se abren a las 17:00 CET- Las charlas comienzan a las 17:45 CET- Habrá pizzas y bebidas- Podría haber una sesión de preguntas y respuestas moderada.... La alineación de ponentes se determinará... - Franco Serra, Arquitecto de Soluciones en Multiverse Computing, dará una charla titulada "Modelos Ultra Eficientes para Escalar tu Centro de Datos de GenAI y Adecuados para el Despliegue en la Borde". Resumen: A medida que las organizaciones compiten por desplegar IA Generativa, dos desafíos dominan: cómo escalar la inferencia de manera económica en el centro de datos, y cómo llevar inteligencia al borde donde la conectividad, la energía y el espacio son limitados. Multiverse Computing desarrolla modelos de IA ultra eficientes y comprimidos, incluyendo LLMs, VLMs, modelos de voz a texto y de visión por computadora, diseñados para ofrecer la misma precisión con una fracción de los requisitos de memoria. Al integrarse con hardware de Intel®, las empresas pueden desplegar modelos de IA más grandes en la infraestructura existente en lugar de expandirla. En el centro de datos, los modelos más ligeros se traducen directamente en mayor rendimiento, menor consumo de energía y un mejor ROI al permitir que más usuarios y cargas de trabajo funcionen en la misma infraestructura. En el borde, los mismos avances en compresión hacen posible desplegar GenAI en entornos restringidos, llevando IA segura y de baja latencia a entornos tácticos. - Thomas Melzer, Arquitecto de Soluciones Senior en Intel, dará una charla sobre el resurgimiento de la relevancia de las CPUs para la inferencia.... - Johan Fondin, Arquitecto de Soluciones en HPE, dará una charla sobre la dinámica del almacenamiento, la transmisión y la memoria... Esperamos verte allí, /Patrick y el equipo de MLOps de Estocolmo
Ubicación del evento
Dile a tu red que vas a ir
Comparte este evento para iniciar conversaciones, invitar colegas y conectar antes de que comience.