
90/30 Klub Czytelniczy: Kompleksowa Infrastruktura Oceny Wydajności dla Akceleratorów LLM opartych na 3D-DRAM
Opis
Dołącz do nas na grupową dyskusję na temat "Kompleksowej Infrastruktury Oceny Wydajności dla Akceleratorów LLM opartych na 3D-DRAM" Link do artykułu: https://arxiv.org/abs/2604.08044This. Ta grupa czytelnicza zbada ATLAS, zweryfikowaną w silikonie ramę do oceny akceleratorów LLM, które układają obliczenia bezpośrednio pod 3D DRAM. Artykuł pokazuje, że szybsze dekodowanie wymaga więcej niż maksymalizacji szerokości pasma pamięci: układ pamięci, równowaga obliczeniowa, komunikacja na chipie, układanie oprogramowania oraz ograniczenia termiczne muszą być współprojektowane. Jego zoptymalizowana architektura chmurowa osiąga 2,53× wyższą wydajność dekodowania i 6,66× lepszą efektywność energetyczną niż NVIDIA H200 w ocenianych obciążeniach. Jest to ważne, ponieważ nowoczesne generowanie LLM jest coraz bardziej ograniczone przez przenoszenie wag modelu i dane z pamięci podręcznej KV, a pamięć zintegrowana w 3D może znacznie przekształcić sprzęt do wnioskowania. Harmonogram wydarzenia: 19:00-20:00: Czas na ciche czytanie, weź przekąskę i czytaj! (opcjonalnie) 20:00-21:00: Dyskusja grupowa na temat artykułu 📝 21:00-22:00: Mamy naszą przestrzeń na trochę dłużej, zostań, aby porozmawiać lub nawiązać kontakty! Nasze wydarzenie odbywa się w Mox SF, hojnym darczyńcy przestrzeni, w której się spotkamy.
Lokalizacja wydarzenia
Daj swojej sieci znać, że idziesz
Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.