
90/30 Club Reading: Eine vollständige Leistungsbewertung Infrastruktur für 3D-DRAM-basierte LLM-Beschleuniger
Beschreibung
Kommt und schließt euch uns an für eine Gruppendiskussion über "Eine vollständige Leistungsbewertung Infrastruktur für 3D-DRAM-basierte LLM-Beschleuniger". Papier-Link: https://arxiv.org/abs/2604.08044This. Diese Lesegruppe wird ATLAS erkunden, ein silikonvaliertes Framework zur Bewertung von LLM-Beschleunigern, die Berechnungen direkt unter 3D DRAM stapeln. Das Papier zeigt, dass schnelleres Decoding mehr erfordert als die Maximierung der Speicherbandbreite: Speicherlayout, Berechnungsbalance, On-Chip-Kommunikation, Software-Tiling und thermische Grenzen müssen gemeinsam entworfen werden. Architektonisch optimierte Cloud-Lösungen erreichen 2,53× höhere Decoding-Leistung und 6,66× bessere Energieeffizienz als ein NVIDIA H200 bei den bewerteten Arbeitslasten. Dies ist wichtig, da moderne LLM-Generierung zunehmend durch die Übertragung von Modellgewichten und KV-Cache-Daten eingeschränkt ist und 3D-integrierter Speicher die Inferenzelektronik erheblich umgestalten könnte. Veranstaltungsplan: 19:00-20:00 Uhr: Ruhige Lesezeit, greift euch einen Snack und lest! (optional) 20:00-21:00 Uhr: Gruppendiskussion über das Papier 📝 21:00-22:00 Uhr: Wir haben unseren Raum noch ein wenig länger, bleibt zum Geselligkeit oder Networking! Unsere Veranstaltung wird in Mox SF ausgerichtet, den großzügigen Spendern des Raumes, in dem wir uns treffen werden.
Veranstaltungsort
Lassen Sie Ihr Netzwerk wissen, dass Sie dabei sind
Teilen Sie diese Veranstaltung, um Gespräche zu beginnen, Kollegen einzuladen und sich vorab zu vernetzen.