Dodaj wydarzenie
90/30 Klub Czytelniczy: Kompleksowa Infrastruktura Oceny Wydajności dla Akceleratorów LLM opartych na 3D-DRAM

90/30 Klub Czytelniczy: Kompleksowa Infrastruktura Oceny Wydajności dla Akceleratorów LLM opartych na 3D-DRAM

07 wrz 202619:00 - 22:00 America/Los_AngelesSan Francisco, United States39 UczestnikówOpen

Opis

Dołącz do nas na grupową dyskusję na temat "Kompleksowej Infrastruktury Oceny Wydajności dla Akceleratorów LLM opartych na 3D-DRAM" Link do artykułu: https://arxiv.org/abs/2604.08044This. Ta grupa czytelnicza zbada ATLAS, zweryfikowaną w silikonie ramę do oceny akceleratorów LLM, które układają obliczenia bezpośrednio pod 3D DRAM. Artykuł pokazuje, że szybsze dekodowanie wymaga więcej niż maksymalizacji szerokości pasma pamięci: układ pamięci, równowaga obliczeniowa, komunikacja na chipie, układanie oprogramowania oraz ograniczenia termiczne muszą być współprojektowane. Jego zoptymalizowana architektura chmurowa osiąga 2,53× wyższą wydajność dekodowania i 6,66× lepszą efektywność energetyczną niż NVIDIA H200 w ocenianych obciążeniach. Jest to ważne, ponieważ nowoczesne generowanie LLM jest coraz bardziej ograniczone przez przenoszenie wag modelu i dane z pamięci podręcznej KV, a pamięć zintegrowana w 3D może znacznie przekształcić sprzęt do wnioskowania. Harmonogram wydarzenia: 19:00-20:00: Czas na ciche czytanie, weź przekąskę i czytaj! (opcjonalnie) 20:00-21:00: Dyskusja grupowa na temat artykułu 📝 21:00-22:00: Mamy naszą przestrzeń na trochę dłużej, zostań, aby porozmawiać lub nawiązać kontakty! Nasze wydarzenie odbywa się w Mox SF, hojnym darczyńcy przestrzeni, w której się spotkamy.

Lokalizacja wydarzenia

Daj swojej sieci znać, że idziesz

Udostępnij to wydarzenie, aby rozpocząć rozmowy, zaprosić kolegów i nawiązać kontakty przed jego rozpoczęciem.

Related events

Platforma sztucznej inteligencji

Bezpłatnie