Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

Die richtige GPU für Qwen3-Inferenz auswählen

Praxis-Guide für LLM-Inferenz auf GPUs: Roofline-Denken, Bandbreite vs. Rechenwerk, Präzision und Auslastung pro Modellgröße.

6 Min. Lesezeitflozi00
aidatacentergpudeep-learninghardwareguide

Diese Übersicht erweitert die Berechnungen aus LLM-Inferenz-Mathematik: Theorie trifft Hardware und wendet sie auf konkrete Hardware- und Modellkombinationen an. Ziel ist es, klar zu machen, wann die NVIDIA RTX PRO 6000, H200 oder die seit Juni 2026 ausgelieferte DGX Station die beste Effizienz für Qwen3-Workloads mit 4B bis 32B aktiven Parametern liefert.

Wichtig: Jede Zahl in diesem Leitfaden stellt eine theoretische Obergrenze dar, die aus Herstellerangaben und vereinfachter Roofline-Mathematik abgeleitet wurde. In der Praxis liegen die Werte oft niedriger, da die Kernels nicht perfekt sind, die Host↔Device-Pipelines Reibung verursachen und GPUs selten über einen gesamten Decode-Durchlauf hinweg 100% Effizienz erreichen.

Zusammenfassung: Die 60-Sekunden ops:byte-Checkliste

  1. Berechnen Sie das ops:byte-Verhältnis der GPU (peak FLOPS ÷ memory bandwidth).
  2. Berechnen Sie die arithmetische Intensität des Modells (≈ d_head ÷ 2 für schrittintensive Attention-Prozesse).
  3. Wenn model_intensity < gpu_intensity ist, ist die Aufgabe speichergebunden; konzentrieren Sie sich auf Bandbreite und VRAM.
  4. Schätzen Sie die Zeit pro Ausgabetoken mit model_size_bytes ÷ memory_bandwidth_bytes_per_second, um eine theoretische Obergrenze für Tokens/s bei Batchgröße 1 abzuleiten.

GPU-Leistungsübersicht

NVIDIA RTX PRO 6000 Blackwell Workstation Edition

  • 96 GB GDDR7 ECC VRAM, gespeist durch 1.792 GB/s Bandbreite und 503,8 TFLOPS FP16/BF16 Tensor (dicht) Rechenleistung — das ist das Verhältnis, das für Inferenz zählt — was zu einem ops:byte-Verhältnis von nahezu 281 führt. (Die ~125 TFLOPS nicht-Tensor-FP32-Shader-Rate würden irreführend ~70 nahelegen; siehe Fußnote im Inferenz-Mathe-Leitfaden.)
  • Die maximale Board-Leistung von 600 W ermöglicht den Einsatz direkt am Arbeitsplatz, wo Geräuschentwicklung und Temperatur wichtig sind, aber die Rack-Leistung begrenzt ist.
  • Ideal, wenn Sie lokale Feinabstimmung oder multimodales Prototyping (Vision, Audio) mit bis zu ~64 GB an Gewichten sowie einem nützlichen KV-Cache-Budget benötigen.1

NVIDIA H200 Tensor Core GPU (SXM + NVL)

  • Erster Hopper-basierter Accelerator mit 141 GB HBM3e und 4,8 TB/s Speicherbandbreite; BF16 Tensor-Leistung erreicht 989 TFLOPS dicht (1.979 TFLOPS mit Sparsity), sodass das ops:byte-Verhältnis auf etwa 206 (dicht) / 412 (sparse) steigt.
  • Wird mit Hardware-MIG-Slicing (7 Instanzen) und optionalen NVL-Konfigurationen für luftgekühlte Racks ausgeliefert.
  • Am besten geeignet für 14B+ dichte Modelle oder MoE-Deployments, bei denen sowohl Kapazität als auch Streaming-Bandbreite die Kosten dominieren.2

NVIDIA DGX Station (Grace Blackwell Ultra)

  • Desktop-Supercomputer, der eine Blackwell-Ultra GPU (252 GB HBM3e @ 7,1 TB/s laut DGX-Station-Datenblatt) mit einer 72-Kern Grace CPU und 496 GB LPDDR5X in einem kohärenten 748 GB Speicherpool kombiniert.
  • NVLink-C2C liefert 900 GB/s zwischen CPU und GPU, sodass große Retrieval-Datensätze ohne PCIe-Nachteile resident bleiben können.
  • Das Datenblatt bewertet die GPU mit 20 PFLOPS FP4 / 5 PFLOPS BF16 (sparse; 15 / 2,5 dicht) — das gleiche Blackwell-Ultra-Silizium wie in HGX B300 Servern, deren 8-GPU-Basisplatine NVIDIA mit 18 PFLOPS BF16 dicht bewertet (~2,25 PFLOPS pro GPU).34
  • Richtet sich an Multi-User-Labore, die lokale Autonomie für iteratives Training, MoE-Routing-Experimente und Agenten-Stacks benötigen, bevor diese an einen Cluster übergeben werden.

Qwen3 Modell-Footprints (Batchgröße 1, BF16)

Kleine, klar abgegrenzte Übersetzungsabschnitte halten die Übersetzungspipeline stabil. Jedes Modell verwendet die GQA-bewusste KV-Cache-Formel (2 * layers * num_kv_heads * head_dim * 2 bytes; alle Qwen3-Modelle unten nutzen 8 KV-Heads mit head_dim 128).

ModelActive paramsHidden size / layersWeights (GB)KV cache per token (MB)Notes
Qwen3-4B-Instruct~4B2,560 / 36~80.15Sliding-window ready; great for CPU offload experiments.5
Qwen3-VL-8B-Instruct~8B4,096 / 36~160.15Vision-language encoder adds ~1152-dim vision tower.6
Qwen3-14B~14B5,120 / 40~280.1640-layer stack with 1M rope theta for 40k context.7
Qwen3-32B~32B5,120 / 64~640.2664 decoder layers; same d_head so arithmetic intensity stays ≈64 ops/byte.8

Passende Szenarien

1. Workstation-Prototyping (RTX PRO 6000)

  • Empfohlene Modelle: Qwen3-4B, Qwen3-VL-8B.
  • Warum: Beide Gewichte (8–16 GB) plus KV-Cache für 4K Tokens lassen immer noch >70 GB VRAM für Batch-Verarbeitung, LoRA-Adapter oder Vision-Embeddings übrig.
  • Durchsatz: Theoretisch tokens/s = 1.792 TB/s ÷ weights. Sie können mit ~220 tok/s (4B) oder ~110 tok/s (8B) rechnen, bevor die Rechenkapazität ausgeschöpft ist, sodass die Latenz hauptsächlich durch Speicherzugriffe und nicht durch Tensor-Operationen bestimmt wird.
  • Tipp: Bleiben Sie rechenbalanciert, indem Sie die Batchgröße auf 4 erhöhen, wann immer das Latenzbudget es zulässt; OBS- oder Whisper-Sidecars beanspruchen kaum VRAM.

2. Enterprise-Copiloten (H200 SXM)

  • Empfohlene Modelle: Qwen3-14B dense, Qwen3-32B MoE Routing mit Batch 1–2.
  • Warum: 141 GB HBM3e ermöglichen die Aufnahme des 64 GB Modells plus >70 GB für Long-Context KV-Caches. Das Verhältnis von ~206 ops:byte (BF16 dicht) bedeutet, dass die arithmetische Intensität (64) Sie speichergebunden hält, sodass der 4.8 TB/s Feed ~170 tok/s auf 14B und ~75 tok/s auf 32B ohne Tensor-Parallelismus ermöglicht.
  • Tipp: Teilen Sie Attention- und Feed-Forward-Layer über MIG-Instanzen auf, wenn Sie mehrere Mandanten bedienen; jede MIG-Slice erhält weiterhin ≥18 GB.

3. Labormaßstab-Supercomputer (DGX Station)

  • Empfohlene Modelle: Jede Qwen3-Variante plus gestapelte Tools (RAG, VLM Agents) dank des 748 GB kohärenten Pools.
  • Warum: 252 GB On-Package HBM3e bedeuten, dass Sie zwei Dense-Modelle oder ein Dense+MoE-Paar gleichzeitig festlegen können, während die Grace CPU die Datenvorverarbeitung mit 396 GB/s übernimmt. NVLink-C2C eliminiert PCIe-Resharding beim Streamen von Dokumenten aus dem RAM in KV-Caches.
  • Durchsatz: Bei 7,1 TB/s, die 64 GB BF16-Gewichte speisen, bleibt die Roofline speichergebunden: planen Sie ~111 tok/s auf einem 32B Dense-Modell (7,1 TB/s ÷ 64 GB) und skalieren Sie mit der Batchgröße, bis sich die Rechenobergrenze (~2,5 PFLOPS BF16 dicht ÷ 2·aktive Parameter) nähert.4
  • Tipp: Verwenden Sie MIG (7 Slices), um kleine Partitionen für Telemetrie- oder Guardrail-Modelle zu reservieren, ohne den Haupt-VLM-Job zu unterbrechen.

Schnelle Zuordnungsmatrix

ScenarioModelGPUEst. tokens/s (batch 1)Primary bottleneckNotes
Edge copilotsQwen3-4BRTX PRO 6000~220Memory BWPlenty of VRAM left for RAG embeddings.
Vision agent demosQwen3-VL-8BRTX PRO 6000~110Memory BWVision tower benefits from 96 GB VRAM for image batches.
Customer support copilotsQwen3-14BH200~170Memory BWMIG lets you mirror-prod topology in dev.
Technical assistant / codegenQwen3-32BH200~75Memory BWRequires tensor parallel if batching >2.
Multi-agent sandboxQwen3-32B + toolsDGX Station~111Memory BW748 GB pool hosts RAG corpora in-memory.

Verwandte Artikel

Interaktiver Rechner

Verwenden Sie den LLM-Inferenz-Planner, um Kontextfenster, Batch-Größen und Präzisionsannahmen für jedes GPU-Profil einem Stresstest zu unterziehen — er berechnet VRAM-Fit, Decode-Durchsatz, Prefill-Latenz und die Break-Even-Batch B* live für jedes Modell und jede GPU in diesem Playbook.

Hinweis: Die Token pro Sekunde erreichen ein Plateau, sobald die Auslastung die Compute-Grenze erreicht – der Rechner vergleicht beide Limits und meldet das strengere.

Footnotes

  1. NVIDIA RTX PRO 6000 Blackwell Workstation Edition specifications, NVIDIA. ↩

  2. NVIDIA H200 Tensor Core GPU specifications, NVIDIA. ↩

  3. NVIDIA DGX Station (Grace Blackwell Ultra) specifications, NVIDIA. ↩

  4. NVIDIA HGX Platform and Blackwell Ultra specifications (HGX B300), NVIDIA. ↩ ↩2

  5. Qwen/Qwen3-4B-Instruct-2507 model card, Hugging Face. ↩

  6. Qwen/Qwen3-VL-8B-Instruct model card, Hugging Face. ↩

  7. Qwen/Qwen3-14B model card, Hugging Face. ↩

  8. Qwen/Qwen3-32B model card, Hugging Face. ↩