
Clube 90/30 Leitura: Uma Infraestrutura de Avaliação de Desempenho Completo para Aceleradores LLM Baseados em 3D-DRAM
Descrição
Junte-se a nós para uma discussão em grupo sobre "Uma Infraestrutura de Avaliação de Desempenho Completo para Aceleradores LLM Baseados em 3D-DRAM". Link do artigo: https://arxiv.org/abs/2604.08044This. Este grupo de leitura explorará o ATLAS, uma estrutura validada em silício para avaliar aceleradores LLM que empilham computação diretamente abaixo do 3D DRAM. O artigo mostra que uma decodificação mais rápida requer mais do que maximizar a largura de banda de memória: o layout da memória, o equilíbrio computacional, a comunicação no chip, o particionamento de software e os limites térmicos devem ser co-projetados. Sua arquitetura otimizada na nuvem alcança um desempenho de decodificação 2.53× mais alto e 6.66× melhor eficiência energética do que um NVIDIA H200 nas cargas de trabalho avaliadas. Isso é importante porque a geração moderna de LLM está cada vez mais restringida pela movimentação de pesos de modelo e dados de KV-cache, e a memória integrada em 3D pode remodelar substancialmente o hardware de inferência. Agenda do Evento: 19h-20h: Tempo de leitura tranquilo, pegue um lanche e leia! (opcional) 20h-21h: Discussão em grupo sobre o artigo 📝 21h-22h: Temos nosso espaço por um pouco mais de tempo, fique para socializar ou fazer networking! Nosso evento é organizado dentro do Mox SF, os generosos doadores do espaço onde nos encontraremos.
Localização do evento
Diga à sua rede que vai participar
Partilhe este evento para iniciar conversas, convidar colegas e conectar-se antes que comece.