Diese Übersicht erweitert die Berechnungen aus LLM-Inferenz-Mathematik: Theorie trifft Hardware und wendet sie auf konkrete Hardware- und Modellkombinationen an. Ziel ist es, klar zu machen, wann die NVIDIA RTX PRO 6000, H200 oder die seit Juni 2026 ausgelieferte DGX Station die beste Effizienz für Qwen3-Workloads mit 4B bis 32B aktiven Parametern liefert.
Wichtig: Jede Zahl in diesem Leitfaden stellt eine theoretische Obergrenze dar, die aus Herstellerangaben und vereinfachter Roofline-Mathematik abgeleitet wurde. In der Praxis liegen die Werte oft niedriger, da die Kernels nicht perfekt sind, die Host↔Device-Pipelines Reibung verursachen und GPUs selten über einen gesamten Decode-Durchlauf hinweg 100% Effizienz erreichen.
Zusammenfassung: Die 60-Sekunden ops:byte-Checkliste
- Berechnen Sie das ops:byte-Verhältnis der GPU (
peak FLOPS ÷ memory bandwidth). - Berechnen Sie die arithmetische Intensität des Modells (≈
d_head ÷ 2für schrittintensive Attention-Prozesse). - Wenn
model_intensity < gpu_intensityist, ist die Aufgabe speichergebunden; konzentrieren Sie sich auf Bandbreite und VRAM. - Schätzen Sie die Zeit pro Ausgabetoken mit
model_size_bytes ÷ memory_bandwidth_bytes_per_second, um eine theoretische Obergrenze für Tokens/s bei Batchgröße 1 abzuleiten.
GPU-Leistungsübersicht
NVIDIA RTX PRO 6000 Blackwell Workstation Edition
- 96 GB GDDR7 ECC VRAM, gespeist durch 1.792 GB/s Bandbreite und 503,8 TFLOPS FP16/BF16 Tensor (dicht) Rechenleistung — das ist das Verhältnis, das für Inferenz zählt — was zu einem ops:byte-Verhältnis von nahezu 281 führt. (Die ~125 TFLOPS nicht-Tensor-FP32-Shader-Rate würden irreführend ~70 nahelegen; siehe Fußnote im Inferenz-Mathe-Leitfaden.)
- Die maximale Board-Leistung von 600 W ermöglicht den Einsatz direkt am Arbeitsplatz, wo Geräuschentwicklung und Temperatur wichtig sind, aber die Rack-Leistung begrenzt ist.
- Ideal, wenn Sie lokale Feinabstimmung oder multimodales Prototyping (Vision, Audio) mit bis zu ~64 GB an Gewichten sowie einem nützlichen KV-Cache-Budget benötigen.1
NVIDIA H200 Tensor Core GPU (SXM + NVL)
- Erster Hopper-basierter Accelerator mit 141 GB HBM3e und 4,8 TB/s Speicherbandbreite; BF16 Tensor-Leistung erreicht 989 TFLOPS dicht (1.979 TFLOPS mit Sparsity), sodass das ops:byte-Verhältnis auf etwa 206 (dicht) / 412 (sparse) steigt.
- Wird mit Hardware-MIG-Slicing (7 Instanzen) und optionalen NVL-Konfigurationen für luftgekühlte Racks ausgeliefert.
- Am besten geeignet für 14B+ dichte Modelle oder MoE-Deployments, bei denen sowohl Kapazität als auch Streaming-Bandbreite die Kosten dominieren.2
NVIDIA DGX Station (Grace Blackwell Ultra)
- Desktop-Supercomputer, der eine Blackwell-Ultra GPU (252 GB HBM3e @ 7,1 TB/s laut DGX-Station-Datenblatt) mit einer 72-Kern Grace CPU und 496 GB LPDDR5X in einem kohärenten 748 GB Speicherpool kombiniert.
- NVLink-C2C liefert 900 GB/s zwischen CPU und GPU, sodass große Retrieval-Datensätze ohne PCIe-Nachteile resident bleiben können.
- Das Datenblatt bewertet die GPU mit 20 PFLOPS FP4 / 5 PFLOPS BF16 (sparse; 15 / 2,5 dicht) — das gleiche Blackwell-Ultra-Silizium wie in HGX B300 Servern, deren 8-GPU-Basisplatine NVIDIA mit 18 PFLOPS BF16 dicht bewertet (~2,25 PFLOPS pro GPU).34
- Richtet sich an Multi-User-Labore, die lokale Autonomie für iteratives Training, MoE-Routing-Experimente und Agenten-Stacks benötigen, bevor diese an einen Cluster übergeben werden.
Qwen3 Modell-Footprints (Batchgröße 1, BF16)
Kleine, klar abgegrenzte Übersetzungsabschnitte halten die Übersetzungspipeline stabil. Jedes Modell verwendet die GQA-bewusste KV-Cache-Formel (2 * layers * num_kv_heads * head_dim * 2 bytes; alle Qwen3-Modelle unten nutzen 8 KV-Heads mit head_dim 128).
| Model | Active params | Hidden size / layers | Weights (GB) | KV cache per token (MB) | Notes |
|---|---|---|---|---|---|
| Qwen3-4B-Instruct | ~4B | 2,560 / 36 | ~8 | 0.15 | Sliding-window ready; great for CPU offload experiments.5 |
| Qwen3-VL-8B-Instruct | ~8B | 4,096 / 36 | ~16 | 0.15 | Vision-language encoder adds ~1152-dim vision tower.6 |
| Qwen3-14B | ~14B | 5,120 / 40 | ~28 | 0.16 | 40-layer stack with 1M rope theta for 40k context.7 |
| Qwen3-32B | ~32B | 5,120 / 64 | ~64 | 0.26 | 64 decoder layers; same d_head so arithmetic intensity stays ≈64 ops/byte.8 |
Passende Szenarien
1. Workstation-Prototyping (RTX PRO 6000)
- Empfohlene Modelle: Qwen3-4B, Qwen3-VL-8B.
- Warum: Beide Gewichte (8–16 GB) plus KV-Cache für 4K Tokens lassen immer noch >70 GB VRAM für Batch-Verarbeitung, LoRA-Adapter oder Vision-Embeddings übrig.
- Durchsatz: Theoretisch
tokens/s = 1.792 TB/s ÷ weights. Sie können mit ~220 tok/s (4B) oder ~110 tok/s (8B) rechnen, bevor die Rechenkapazität ausgeschöpft ist, sodass die Latenz hauptsächlich durch Speicherzugriffe und nicht durch Tensor-Operationen bestimmt wird. - Tipp: Bleiben Sie rechenbalanciert, indem Sie die Batchgröße auf 4 erhöhen, wann immer das Latenzbudget es zulässt; OBS- oder Whisper-Sidecars beanspruchen kaum VRAM.
2. Enterprise-Copiloten (H200 SXM)
- Empfohlene Modelle: Qwen3-14B dense, Qwen3-32B MoE Routing mit Batch 1–2.
- Warum: 141 GB HBM3e ermöglichen die Aufnahme des 64 GB Modells plus >70 GB für Long-Context KV-Caches. Das Verhältnis von ~206 ops:byte (BF16 dicht) bedeutet, dass die arithmetische Intensität (64) Sie speichergebunden hält, sodass der 4.8 TB/s Feed ~170 tok/s auf 14B und ~75 tok/s auf 32B ohne Tensor-Parallelismus ermöglicht.
- Tipp: Teilen Sie Attention- und Feed-Forward-Layer über MIG-Instanzen auf, wenn Sie mehrere Mandanten bedienen; jede MIG-Slice erhält weiterhin ≥18 GB.
3. Labormaßstab-Supercomputer (DGX Station)
- Empfohlene Modelle: Jede Qwen3-Variante plus gestapelte Tools (RAG, VLM Agents) dank des 748 GB kohärenten Pools.
- Warum: 252 GB On-Package HBM3e bedeuten, dass Sie zwei Dense-Modelle oder ein Dense+MoE-Paar gleichzeitig festlegen können, während die Grace CPU die Datenvorverarbeitung mit 396 GB/s übernimmt. NVLink-C2C eliminiert PCIe-Resharding beim Streamen von Dokumenten aus dem RAM in KV-Caches.
- Durchsatz: Bei 7,1 TB/s, die 64 GB BF16-Gewichte speisen, bleibt die Roofline speichergebunden: planen Sie ~111 tok/s auf einem 32B Dense-Modell (7,1 TB/s ÷ 64 GB) und skalieren Sie mit der Batchgröße, bis sich die Rechenobergrenze (~2,5 PFLOPS BF16 dicht ÷ 2·aktive Parameter) nähert.4
- Tipp: Verwenden Sie MIG (7 Slices), um kleine Partitionen für Telemetrie- oder Guardrail-Modelle zu reservieren, ohne den Haupt-VLM-Job zu unterbrechen.
Schnelle Zuordnungsmatrix
| Scenario | Model | GPU | Est. tokens/s (batch 1) | Primary bottleneck | Notes |
|---|---|---|---|---|---|
| Edge copilots | Qwen3-4B | RTX PRO 6000 | ~220 | Memory BW | Plenty of VRAM left for RAG embeddings. |
| Vision agent demos | Qwen3-VL-8B | RTX PRO 6000 | ~110 | Memory BW | Vision tower benefits from 96 GB VRAM for image batches. |
| Customer support copilots | Qwen3-14B | H200 | ~170 | Memory BW | MIG lets you mirror-prod topology in dev. |
| Technical assistant / codegen | Qwen3-32B | H200 | ~75 | Memory BW | Requires tensor parallel if batching >2. |
| Multi-agent sandbox | Qwen3-32B + tools | DGX Station | ~111 | Memory BW | 748 GB pool hosts RAG corpora in-memory. |
Verwandte Artikel
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive — die Speicher-Mathematik hinter jeder Einordnung.
- LLM-Inferenzrechner & Break-Even-Analyse — prüfen Sie eine Kombination vor dem Kauf.
Interaktiver Rechner
Verwenden Sie den LLM-Inferenz-Planner, um Kontextfenster, Batch-Größen und Präzisionsannahmen für jedes GPU-Profil einem Stresstest zu unterziehen — er berechnet VRAM-Fit, Decode-Durchsatz, Prefill-Latenz und die Break-Even-Batch B* live für jedes Modell und jede GPU in diesem Playbook.
Hinweis: Die Token pro Sekunde erreichen ein Plateau, sobald die Auslastung die Compute-Grenze erreicht – der Rechner vergleicht beide Limits und meldet das strengere.
Footnotes
-
NVIDIA RTX PRO 6000 Blackwell Workstation Edition specifications, NVIDIA. ↩
-
NVIDIA DGX Station (Grace Blackwell Ultra) specifications, NVIDIA. ↩
-
NVIDIA HGX Platform and Blackwell Ultra specifications (HGX B300), NVIDIA. ↩ ↩2
-
Qwen/Qwen3-4B-Instruct-2507 model card, Hugging Face. ↩
-
Qwen/Qwen3-VL-8B-Instruct model card, Hugging Face. ↩
-
Qwen/Qwen3-14B model card, Hugging Face. ↩
-
Qwen/Qwen3-32B model card, Hugging Face. ↩