
#39 - Otimização de Modelos e Inferência Baseada em CPU
Descrição
Tudo certo!!! O Meetup #39 ocorrerá em 24 de setembro na AI Sweden e focará em "Otimização de Modelos e Inferência Baseada em CPU". Estamos super animados em nos juntar aos magos da Quantum AI espanhola, a Multiverse Computing, e aos gigantes da tecnologia Intel e HPE. O programa está atualmente sendo elaborado, então fique atento a atualizações! Há uma quantidade tremenda de novidades na área de otimização de modelos e inferência. Novas abordagens parecem ser anunciadas diariamente, como a possibilidade de rodar o modelo Kimi K3, lançado recentemente com 2,78 trilhões de parâmetros, em uma única CPU com 8GB de memória...!!! ou o anúncio da Multiverse Computing em 23 de julho de que todos os seus modelos comprimidos agora rodam em Processadores Intel Xeon 6. Então, apertem os cintos e preparem-se para a decolagem! Programa do Evento- Portas abertas às 17:00 CET- Palestras começam às 17:45 CET- Haverá pizzas e bebidas- Pode haver uma sessão de perguntas e respostas moderada.... Alinhamento de Palestrantes a ser definido... - Franco Serra, Arquiteto de Soluções na Multiverse Computing, dará uma palestra intitulada "Modelos Ultra Eficientes para Escalar seu Datacenter de GenAI & Adaptados para implantação na Edge". Resumo: À medida que as organizações correm para implantar a IA Generativa, dois desafios dominam: como escalar a inferência de maneira econômica no datacenter, e como trazer inteligência para a edge, onde conectividade, energia e espaço são limitados. A Multiverse Computing cria modelos de IA ultra-eficientes e comprimidos, incluindo LLMs, VLMs, modelos de fala para texto e visão computacional — projetados para oferecer a mesma precisão com uma fração dos requisitos de memória. Ao integrar-se ao hardware da Intel®, as empresas podem implantar modelos de IA maiores na infraestrutura existente em vez de expandi-la. No datacenter, modelos mais enxutos se traduzem diretamente em maior capacidade de processamento, menor consumo de energia e melhor ROI, permitindo que mais usuários e cargas de trabalho rodem na mesma infraestrutura. Na edge, os mesmos avanços em compressão possibilitam a implantação de GenAI em ambientes restritos — levando IA segura e de baixa latência a ambientes táticos. - Thomas Melzer, Arquiteto de Soluções Sênior na Intel, dará uma palestra sobre o ressurgimento da relevância dos CPUs para inferência.... - Johan Fondin, Arquiteto de Soluções na HPE, dará uma palestra sobre a dinâmica de armazenamento, streaming e memória... Aguardamos você lá, /PATRICK & a Equipe de MLOps de Estocolmo
Localização do evento
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.