Auf der Hot Chips 2026 kündigte NVIDIA an, dass der Groq 3 LPX — die SRAM-residente Decode-Engine aus dem Dezember-2025-Groq-Deal — in voller Serienproduktion ist.12
Der Pitch ist ein Satz: Decode ist speicherbandbreitenlimitiert, also gehören die Gewichte in den schnellsten Speicher, den es gibt — On-Die-SRAM — und nicht pro Token aus dem HBM gestreamt. Dieser Satz ist korrekt. Der Rest dieses Guides ist die Arithmetik, die in der Keynote fehlte: das Bandbreite-pro-FLOP-Verhältnis, die Kapazitätsklippe, was die 3.431 Tok/s von Artificial Analysis tatsächlich messen — und gegen welchen Baseline die 35x-Marketingzahl gerechnet ist.
Eines vorweg, weil die Berichterstattung es nicht sagt: Das hier ist weiterverkaufte Groq-Technologie. NVIDIA übernahm das LP30-Design im Rundum-20-Milliarden-Dollar-Lizenzdeal vom 24. Dezember 2025, stellte Gründer Jonathan Ross, Präsident Sunny Madra und die meisten Ingenieure ein — und drückte einem bei Samsung gefertigten Chip sein eigenes Logo auf. Der Hot-Chips-Vortragende, Igor Arsovski, ist Groqs ehemaliger Chefarchitekt.341
Das Rack, in Zahlen
Jeder LP30-Chip trägt rund 500 MB On-Die-SRAM und kein HBM. Ein volles LPX-Rack fasst 256 davon in 32 flüssigkeitsgekühlten 1U-Trays nach MGX-Architektur, Vera-Rubin-kompatibel, mit einem Fabric über 1.000 LPUs hinaus:15
| Spezifikation | Groq-3-LPX-Rack |
|---|---|
| Chips | 256 × LP30 (8 pro Tray) |
| On-Die-SRAM | ~500 MB pro Chip, 128 GB pro Rack |
| SRAM-Bandbreite gesamt | 38,4 PB/s (256 × 150 TB/s; NVIDIA rundet auf 40 PB/s) |
| FP8-Rechenleistung | 315 PFLOPS |
| Chip-zu-Chip-Latenz | 350 ns |
| Scale-up-Bandbreite | 640 TB/s |
| DDR5-Auslagerung | ~12 TB (256 GB Fabric-DRAM + 128 GB Host-DRAM pro Tray) |
| Chip-zu-Chip-Links | 96 pro LPU bei 112 Gbps, 2,5 TB/s I/O gesamt |
Die Architektur ist Groqs, nicht NVIDIAs: deterministische, compiler-schedulierte Ausführung, keine Caches, keine Sprungvorhersage, keine Out-of-Order-Maschinerie. Der Compiler plant die Pipeline mit Takt-Genauigkeit über feste 320-Byte-Vektoren — das Tensor-Streaming-Prozessor-Design aus der ISCA-Publikation „Think Fast" (2020), vorgestellt auf der Hot Chips unter gleichem Titel von Arsovski und Santosh Raghavan.15
Der Determinismus hat einen Nebeneffekt, den niemand einpreist: Weil der Compiler den Stromverbrauch Zyklus für Zyklus vorhersagen kann, bestellt das Rack Strom bei den Reglern nach, bevor die Nachfrage da ist — Spannungseinbrüche sinken um mehr als 60 %, Überschwingen um mehr als 70 % gegenüber einer unkompensierten Last. Eine Workload ohne Jitter ist auch eine Stromversorgung ohne Jitter.1
Bandbreite pro FLOP: die Zahl, die kein GPU-Hersteller druckt
Decode bei Batch-Größe 1 ist die ungünstigste Rechenoperation der Informatik: Für einen Token müssen praktisch alle Gewichte des Modells einmal gelesen werden, während nur ~2 × Parameter FLOPs anfallen. Ein 31B-Modell investiert ~62 GFLOPs pro Token; die Frage ist, wie schnell man 31 GB bewegen muss, um sie zu verdienen.
Die Kennzahl, die das Decode-Tempo bestimmt, ist Speicherbandbreite pro Recheneinheit. Rechnen wir sie für beide Maschinen aus:
| Maschine | Bandbreite | FP8-Rechenleistung | Bandbreite pro PFLOP |
|---|---|---|---|
| LPX-Rack | 38,4 PB/s | 315 PFLOPS | ~122 TB/s |
| Rubin-GPU | 22 TB/s HBM4 | ~17,5 PFLOPS | ~1,26 TB/s |
Das sind grob 97-mal mehr Bandbreite pro FP8-FLOP für das LPU-Rack — zählt man stattdessen Rubins 50 NVFP4-PFLOPS, sogar rund 270x. Eines dieser Verhältnisse stand auf keiner NVIDIA-Folie.56
Pro Chip: Die 150 TB/s eines LP30 sind etwa das 6,8-Fache der 22 TB/s HBM4 einer Rubin-GPU. Für diese Quote aus HBM bräuchte man Taktraten, die auf keiner Roadmap von 2026 existieren; die ~8 TB/s HBM3E der Vorgängergeneration machen die Lücke pro Chip rund 19x aus. Das ist der gesamte technische Fall, und er ist echt: Eine GPU bei Batch 1 wartet den Großteil jedes Tokens darauf, dass Gewichte den HBM-Bus überqueren; die LPU rechnet in dieser Zeit.
Die Kehrseite: Das LPX hat weit mehr Bandbreite, als seine Rechenleistung verbrauchen kann. Bei 315 FP8-PFLOPS über 38,4 PB/s braucht die Compute-Sättigung 8,2 FLOP pro geliefertem Byte — rund 4× Wiederverwendung jedes Gewicht-Bytes, wenn ein MAC 2 FLOPs liefert. Decode wiederverwendet nichts — jedes Gewicht wird genau einmal berührt, der Stream trägt also höchstens ~24 % des FP8-Peaks. Diese Lücke ist keine Verschwendung, sondern der Kern des Designs. Es bedeutet aber auch: Die 315-PFLOPS-Zahl ist für das, was das Rack tut, fast irrelevant — man merke sich das, wann immer sie neben einer GPU-FLOPS-Zahl steht.
Die Kapazitätsklippe
SRAM-Kapazität ist pro Chip erbarmungslos kleiner: Ein LPU trägt 500 MB gegen 288 GB HBM4 je Rubin-GPU — ein Kapazitätsverhältnis von 576:1. Alle 256 LPUs des Racks zusammen tragen 128 GB SRAM — weniger als die H'lfte des Speichers eines einzigen Rubin-GPUs, in einer Maschine, die wie ein volles Rack kostet.1 Nun die ehrliche Dimensionierung — denn die Launch-Berichterstattung bekam die zentrale Zahl falsch.
Gemma 4 31B — das Modell, das NVIDIA benchmarken ließ — hat 30,7 Milliarden Parameter, ihre FP8-Gewichte sind also rund 31 GB, nicht die kursierenden „62 GB". Die 62 in der Tom's-Hardware-Berichterstattung sind LPUs, nicht Gigabyte: 31 GB ÷ 500 MB = etwa 62 LPUs, ein Viertel eines Racks, drei Viertel des SRAM bleiben übrig — und die gesamte DDR5-Stufe liegt brach.17 Der Launch-Benchmark berührt die Kapazitätsklippe also gar nicht; genau deshalb wurde er gewählt.
Auch der KV-Cache liegt nicht im SRAM. Im Attention-FFN-Disaggregationsmodus (unten) bleiben Attention und ihr 100K-Token-KV-Cache auf Rubin-HBM, wohin Kapazität-für-Kontext gehört; nur die FFN-Gewichte wohnen auf dem LPU-Fabric.5 Das SRAM wird also allein für Gewichte ausgegeben — die richtige Entscheidung, aber eine, die den Kapazitätspunkt eingebaut, bevor der Benchmark überhaupt startet.
Die Klippe kommt dort, wo das Geld ist: bei Billionen-Parameter-MoE-Modellen. Ein 2-Billionen-Parameter-Modell hat im FP8-Format ~2 TB Gewichte:
- 2 TB ÷ 500 MB = 4.000 LPUs = 16 Racks, jenseits der 1.000-LPU-Skala, die NVIDIA zitiert, das Fabric über mehrere Racks gespannt.
- Tom's Hardware sagt dasselbe von der anderen Seite: Große MoE-Modelle landen „im vierstelligen Chipbereich über mehrere Racks".1
- Jede Expert-Layer-Grenze überquert Chip-zu-Chip-Links mit 350 ns pro Sprung — und die attention-lastige Arbeit braucht weiterhin Rubin-HBM.
NVIDIAs eigene Split-Mode-Zahlen (3–5x über Rubin allein) sind exakt in diesem Maßstab gemessen — 2T Parameter, 400K-Token gecachter Kontext — was zeigt: Das Unternehmen weiß, dass das Ein-Rack-Regime eine Demo ist und das Mehr-Rack-Regime das Produkt.15 Ob das deterministische Fabric sein 350-ns-Versprechen über 16 Racks hält, ist die wichtigste ungeprüfte Engineering-Aussage der ganzen Geschichte.
Die 3.431 Tok/s, zerlegt
Artificial Analysis maß das LPX mit 3.431 Output-Tokens pro Sekunde auf Gemma 4 31B Reasoning bei 100K-Token-Kontext — gegen rund 870 Tok/s des schnellsten öffentlichen Endpunkts, etwa 4x, das schnellste jemals für dieses Modell gemessene Ergebnis.18
Zwei Einschränkungen vor dem Lob. Der Vergleich lief auf einem privaten, pre-release Endpunkt über Google Cloud; die Methodik war der Median aus 50 sequenziellen Client-Requests bei Konkurrenz eins. Das ist ein Single-User-Latenztest — das Regime, für das LPX gebaut ist — und kein Durchsatztest; vergleichbar mit gebatchten Serving-Zahlen ist er nicht.1
Nun die Dekomposition, warum die Lücke ~4x beträgt. Nicht, weil die SRAM-Bandbreite ausgelastet ist — sie ist es nirgendwo:
- Die Bandbreiten-Decke ist astronomisch. 31 GB Gewichte pro Token erneut zu lesen würde bei 38,4 PB/s aggregiert ~1,2 Millionen Tok/s erlauben. Selbst ein einzelner LP30, der nur sein eigenes 500-MB-Slice liest, kommt bei 150 TB/s auf ~300.000 Tok/s. Die gemessenen 3.431 Tok/s sind ~0,3 % der Bandbreiten-Roofline.
- Decode auf dem LPX ist also latenzlimitiert, nicht bandbreitenlimitiert. Bei 3.431 Tok/s verlässt ein Token das Rack alle ~291 Mikrosekunden. Dieses Budget geht an die ~62-Chip-Gewichts-Pipeline, die 350-ns-Fabric-Sprünge, den Attention-Schritt auf Rubin-HBM gegen einen 100K-Token-KV-Cache und die Aktivierungs-Übergänge pro Token zurück in die GPU-Domäne.15
- Die 870 Tok/s des Vergleichsendpunkts bestätigen die Theorie. Eine einzelne Rubin-Klasse-GPU, die 31 GB Gewichte pro Token mit 22 TB/s liest, schafft höchstens ~709 Tok/s. Der schnellste öffentliche GPU-Endpunkt maß 870 — innerhalb ~20 % dieser Decke. Diese Zahl ist die HBM-Bandbreitenwand, sichtbar in Produktionsdaten. Das LPX gewinnt, weil es vor dieser Wand gar nicht erst steht: Bandbreite pro Token ist praktisch gratis, wenn die Gewichte den Die nie verlassen.
Das ist die ehrliche Dekomposition: Die GPU-Zahl ist eine Bandbreitenmessung, die LPU-Zahl eine Latenzmessung — und die Lücke zwischen beiden ist exakt die Lücke zwischen HBM und SRAM. NVIDIAs eigene „11.000 Tok/s" auf der Bühne für dasselbe Modell ist genauso zu lesen: herstellergemessen, ein Stream, keine Drittmethodik.9
Drei Split-Modi — und AFD als Silizium-Partitionierung
NVIDIA verkauft die LPU nicht als GPU-Ersatz; sie ist ein Decode-Coprozessor neben Vera Rubin NVL72, orchestriert von der Dynamo-Runtime mit einer LPU-Erweiterung zu CUDA, ein FPGA brückt die Grenze zwischen der synchronen LPU-Domäne und dem asynchronen Host- und GPU-I/O.15 Drei Betriebsmodi:
- PD-Disaggregation — Rubin-GPUs laufen Prefill und bauen den KV-Cache; LPUs generieren Output-Tokens. Der klassische Prefill/Decode-Split, nun über zwei Silizium-Familien statt über zwei Prozesspools.
- Attention-FFN-Disaggregation (AFD) — innerhalb des Decode behalten die GPUs Attention und KV-Cache auf HBM, während die LPUs die Feed-Forward- und MoE-Expert-Layer rechnen, mit Austausch der Zwischenaktivierungen pro Token.5 Das ist Disaggregation, befördert von einem Software-Scheduling-Trick (den vLLM und Dynamo in homogenen GPU-Clustern längst beherrschen) zu einer physischen Partition des Siliziums nach Speicherlokalität: der Decode-Teil, der Kapazität braucht (KV), wohnt auf HBM; der Teil, der Bandbreite braucht (FFN-Gewichte), wohnt im SRAM. Der intellektuell ernsthafteste der drei Modi — und der, dessen Aktivierungstraffic über die GPU/LPU-Grenze klein bleiben muss, denn er läuft einmal je Token — rund 3.430 Überquerungen pro Sekunde beim AA-gemessenen 3.431 tok/s (eine alle 291 µs).
- External-Draft Speculative Decoding — ein kleines Draft-Modell auf der LPU schlägt Token rapid aus dem SRAM vor; die GPU(s) verifizieren parallel, nur Draft-Tokens überqueren den Link.15 Speculative Decoding verlagert den Flaschenhals in die Akzeptanzrate; die LPU ist ein sehr guter Drafter, denn Draft-Modell-Gewichte passen trivial in 128 GB SRAM. Futurum bezeichnete External-Draft als den Mechanismus, den NVIDIA auf der Hot Chips hervorhob.2
Die 35x-Zahl, gemessen gegen das Silizium von 2024
NVIDIAs Ökonomie-Schlagzeile — „bis zu 35x höherer Inferenz-Durchsatz pro Megawatt und bis zu 10x mehr Umsatzchance" — verdient einen eigenen Audit:5
- Die Baseline ist das GB200 NVL72, nicht Rubin. Das ist Blackwell: zum Zeitpunkt der Aussage zwei GPU-Generationen alt — und ein Rack, das man 2026 für Premium-Interaktivität ohnehin nicht kaufen würde.
- Rubin NVL72 allein beansprucht schon bis zu 5x über GB200. Doch die beiden Multiplikatoren liegen auf verschiedenen Achsen, und das Deck vermengt sie: Die 5x (mit LPX 10x) ist eine Umsatz-pro-Megawatt-Aussage, die 35x eine Durchsatz-pro-Megawatt-Aussage. Auf der Umsatzachse steuert LPX die letzten ~2x bei (10÷5); auf der Durchsatzachse liegt NVIDIAs publizierter Rubin-vs-GB300-Generationssprung bei ~3x, was LPX den Großteil der 35x ließe. NVIDIA zerlegt die 35x nirgends — jede Aufteilung ist unverifizierte Modellierung.5
- Das „bis zu" trägt schwer: Der Workload ist ein 2T-Parameter-MoE mit 400K-Token gecachtem Kontext bei 400 TPS pro User — exakt die Form, die SRAM-Residenz schmeichelt. Alle Zahlen sind NVIDIA-eigene Modellierung; keine dritte Partei hat die 35x oder die 10x reproduziert.52
- Der Effizienzgewinn ist mit Kapazität erkauft, die man bezahlt, aber nicht nutzen kann. Tokens-pro-Watt unterschlägt Dollar-pro-Gigabyte — des LPX schlechtestes Verhältnis. Futurum nennt für das Rack Straßenzitate von bis zu 1 Million US-Dollar — das legt fest, wie hoch der Latenz-Preis pro Token sein muss, damit die Rechnung aufgeht.2
Es ist dasselbe Muster wie bei AMDs „34x": ein großer Multiplikator gegen einen veralteten Baseline, bei einem Workload, der auf die Stärke der neuen Maschine zugeschnitten ist. Der Unterschied: LPX' physikalische Argumentation übersteht den Audit — siehe die Bandbreite-pro-FLOP-Tabelle oben.
Urteil: Wo das LPX gewinnt, wo nicht — und was NVIDIA wirklich kauft
Das LPX gewinnt, wenn Latenz pro User das Produkt ist: Batch-1-Agenten-Loops, Coding-Assistenten, Sprachausgabe — alles, wo 3.000+ Tok/s für einen Nutzer mehr wert sind als 30 Tok/s für 100 gleichzeitige Nutzer. Für dieses Regime ist die Bandbreite-pro-FLOP-Mathematik keine Werbung, sondern das erste Produktionsdesign, das die Decode-Roofline wörtlich nimmt — und die AA-3.431-Tok/s zeigen, dass die Latenz hält.18
Das LPX verliert, wenn Kapazität der Engpass ist: Modelle jenseits einiger hundert Gigabyte im FP8-Format, Durchsatz-Serving mit hoher Konkurrenz, wo Batching die HBM-Kosten sauber amortisiert, und Langkontext-Attention — die die eigene Architektur an Rubin-HBM delegiert. MoE-Maßstab ist die offene Frage: 16 Racks und vierstellige Chip-Anzahlen sind der Punkt, an dem SRAM-Ökonomie vom Hebel zur Steuer wird — und an dem das 350-ns-Fabric-Versprechen über Racks halten muss, auf denen es nie demonstriert wurde.15
Was NVIDIA tatsächlich kauft, ist defensiv. Der Groq 3 LPX ist eine Antwort auf Groq und Cerebras in dem einen Segment — Single-Stream-Decode-Geschwindigkeit —, in dem eine Generalzweck-GPU architektonisch falsch ist, geliefert acht Monate nach einem 20-Milliarden-Dollar-Lizenzdeal, der als Nicht-Fusion konstruiert wurde, um eine Kartellprüfung zu vermeiden (zwei US-Senatoren haben die FTC bereits befragt; derselbe Deal soll im März den Rubin CPX von der GTC-Roadmap geschoben haben).231 Es hält spezialisierte Decode-Herausforderer von der Premium-Interaktivitätsstufe fern, solange Rubin hochfährt — und klemmt einen weiteren Rack-Typ in die Vera-Rubin-Plattform, mit LP35 (NVFP4) 2027 und LP40 (NVLink statt Groq-Interconnect) 2028 bereits auf der Roadmap.
Die Hot-Chips-Folien sind Silizium-Mathematik. Das Geschäft ist Plattform-Strategie, ausgeführt in Samsung-gefertigtem Ex-Groq-Silizium und zu einem Preis, den Tokens-pro-Watt nicht erklärt.
Footnotes
-
Tom's Hardware, Hot Chips 2026: Nvidia presents Groq 3 LPX architecture and unveils its first third-party inference benchmark, tomshardware.com/tech-industry/semiconductors/nvidia-presents-groq-3-lpx-architecture-and-unveils-its-first-third-party-inference-benchmark (abgerufen 24.09.2026). ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17
-
Futurum Group, Brendan Burke, NVIDIA Groq 3 LPX's Promise of World's Fastest Inference Enters Full Production, futurumgroup.com/insights/nvidia-groq-3-lpxs-promise-of-worlds-fastest-inference-enters-full-production/ (14.09.2026). ↩ ↩2 ↩3 ↩4 ↩5
-
CNBC, Nvidia buying AI chip startup Groq's assets for about $20 billion, biggest deal on record, cnbc.com/2025/12/24/nvidia-buying-ai-chip-startup-groq-for-about-20-billion-biggest-deal.html (24.12.2025). ↩ ↩2
-
Reuters, Nvidia to license Groq technology, hire executives, reuters.com/business/nvidia-buy-ai-chip-startup-groq-about-20-billion-cnbc-reports-2025-12-24/ (24.–26.12.2025). ↩
-
NVIDIA Technical Blog, Inside NVIDIA Groq 3 LPX: The Low-Latency Inference Accelerator for the NVIDIA Vera Rubin Platform, developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform (16.03.2026; abgerufen 24.09.2026). ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13
-
NVIDIA Vera Rubin NVL72 Spezifikationen — 288 GB HBM4 bei 22 TB/s pro GPU, 50 PFLOPS NVFP4 pro GPU, 1.260 PFLOPS FP8 im 72-GPU-Rack — von NVIDIA auf CES/GTC 2026 veröffentlicht, tabelliert unter spheron.network/blog/nvidia-vera-rubin-nvl72-guide/ (abgerufen 24.09.2026). ↩
-
Artificial Analysis, Gemma 4 31B (Reasoning) — 30,7 Mrd. Parameter gesamt, artificialanalysis.ai/models/gemma-4-31b (abgerufen 24.09.2026). ↩
-
NVIDIA-Pressemitteilung, NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI, nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai (24.08.2026). ↩ ↩2
-
lavx.news, Hot Chips 2026: Nvidia details Groq 3 LPX architecture and reports first outside benchmark — NVIDIAs 11.000-Tok/s-Selbstmessung auf Gemma 4 31B, news.lavx.hu/article/hot-chips-2026-nvidia-details-groq-3-lpx-architecture-and-reports-first-outside-benchmark (abgerufen 24.09.2026). ↩