Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

KV-Cache-Speicherwachstums-Explorer

Sehen Sie, wie der KV-Cache eines Agenten den freien HBM eines Knotens füllt, während der Kontext wächst — über GQA-, MLA- und hybride Aufmerksamkeitsmodelle hinweg, mit live Füllbalken pro Modell.

2 Min. Lesezeitflozi00
aigpuinferencevllmdeep-learningtoolscalculator

Ein Knoten hat eine feste Menge HBM. Die Gewichte nehmen ihren Anteil, und was bleibt, ist der KV-Pool — der Speicher, den Ihre laufenden Agenten für ihren Kontext mieten. Wie hoch diese Miete ausfällt, entscheidet sich allein darin, was ein Modell pro Token an Aufmerksamkeitszustand speichert.

Der Explorer unten zeigt genau dieses Rennen. Wählen Sie GPU und Knotenbreite, wählen Sie die Gewichts-Präzision, und ziehen Sie dann den Kontext-Regler: Jede Aufmerksamkeitsfamilie (GQA, MLA, hybride lineare Aufmerksamkeit) frisst sich mit sehr unterschiedlicher Geschwindigkeit durch den Pool. Jede Zeile nimmt an: ein Modell pro Knoten — seine Gewichte sind bereits resident, seine Agenten teilen sich den Rest.

Alle Zahlen sind theoretische Obergrenzen aus Hersteller-Specs und derselben kvPerToken()-Mathematik wie im Inferenzrechner — Modell- und GPU-Konstanten stammen aus derselben Datenquelle, die beiden Tools können sich also nie widersprechen.

Interaktiver Rechner

KV-Cache-Speicherwachstums-Explorer

Sehen Sie, wie der KV-Cache eines Agenten den freien HBM-Speicher des Knotens füllt, während sein Kontext wächst — über Attention-Familien hinweg (GQA, MLA, hybride lineare Aufmerksamkeit). Dieselben Modell- und GPU-Daten wie im Inferenzrechner, damit jede Zahl konsistent bleibt.

GLM-5.2 (753B-A40B, MLA + DSA)MoE + MLA + DeepSeek-style Sparse AttentionMLA ≈ ×43 kleiner als GQA mit gleicher Kopfzahl
87.8 KiB/token
KV bei diesem Kontext: 10.97 GiBGleichzeitige Agenten bei diesem Kontext: 116Max. Kontext für 1 Agenten: 1.048.576 tokens
DeepSeek V3.2-671B-A37B (MoE + MLA)MoE + Multi-head Latent AttentionMLA ≈ ×57 kleiner als GQA mit gleicher Kopfzahl
68.6 KiB/token
KV bei diesem Kontext: 8.58 GiBGleichzeitige Agenten bei diesem Kontext: 158Max. Kontext für 1 Agenten: 163.840 tokens
Qwen3-Next-80B-A3B (hybrid MoE)Hybrid Gated-DeltaNet + MoE
24.0 KiB/token
KV bei diesem Kontext: 3.00 GiBGleichzeitige Agenten bei diesem Kontext: 641Max. Kontext für 1 Agenten: 262.144 tokens
Llama 3.3-70B (dense)Dense GQA
320.0 KiB/token
KV bei diesem Kontext: 40.00 GiBGleichzeitige Agenten bei diesem Kontext: 48Max. Kontext für 1 Agenten: 131.072 tokens
Qwen3-32B (dense)Dense GQA
256.0 KiB/token
KV bei diesem Kontext: 32.00 GiBGleichzeitige Agenten bei diesem Kontext: 61Max. Kontext für 1 Agenten: 131.072 tokens

Modelle

Qwen dense

Qwen MoE

Qwen3.8 / Qwen4-exp

Llama / open

DeepSeek

GLM / Z.ai (Zhipu)

Qwen3.5 / 3.6

NVIDIA

KV-Bytes pro Token = 2 · KV-Köpfe · Kopf-Dimension · Präzision · KV-Ebenen (GQA) bzw. (Latent- + RoPE-Dimension) · Präzision · KV-Ebenen (MLA); Hybridmodelle zählen nur Full-Attention-Ebenen. MTP-Draft-Ebenen und Aktivierungsspeicher sind ausgenommen. Formel folgt kvPerToken() des Inferenzrechners.

Warum die Familien so stark auseinanderlaufen

Drei architektonische Entscheidungen bestimmen die Steigung jeder Kurve:

  • GQA speichert die vollen K und V für seine KV-Gruppen. Llama-3.3-70B hält 8 KV-Köpfe × 128 Kopf-Dim über 80 Ebenen — 320 KiB pro Token in BF16.
  • MLA speichert ein komprimiertes Latent. GLM-Stil kv_lora_rank 512 + 64 RoPE-Dim komprimiert auf ~88 KiB/Token — eine hypothetische GQA-Version desselben Modells mit gleicher Kopfzahl bräuchte ~3,7 MiB pro Token (rund 43-mal mehr), was kein einzelner Knoten bei langem Kontext überlebt.
  • Hybride lineare Aufmerksamkeit (Qwen3-Next) hält KV nur in jeder 4. Ebene (2 KV-Köpfe × 256 Kopf-Dim), die anderen 36 Ebenen tragen einen winzigen rekurrenten Zustand fester Größe — ~24 KiB/Token plus eine kleine Konstante.

Die praktische Lehre für die Fleet-Planung: Auf einem 8×B300-Knoten mit residenten GLM-5.2-fp8-Gewichten kostet ein Agent mit 128K Kontext rund 11 GiB Pool (KV in BF16) — es bleiben ~116 gleichzeitige Agenten bei diesem Kontext (roh, ohne Laufzeit-Marge). Bei 1M Kontext kostet derselbe Agent 88 GiB und auf den Knoten passen ~14 davon — Long Context ist keine bloße „Qualitäts"-Achse, sondern die dominante Kapazitätsachse.

Was der Explorer bewusst ausklammert

Um ehrlich zu bleiben, vernachlässigt die Schätzung Prefill-Aktivierungsspitzen, Präfix-Wiederverwendung im Stil von RadixAttention, MTP-Draft-KV und Offloading — jedes einzelne davon verschiebt echte Deployments, und jedes einzelne bestraft naïve Planung. Betrachten Sie die Zahlen als Obergrenze für Kapazität, nicht als Durchsatz-Versprechen.

Wo es weitergeht