LLM-Serving ist ein Sandwich aus Physik und Ökonomie. Die Physik — Speicherbandbreite, FLOPS, VRAM-Kapazität — begrenzt, wie viele Token eine GPU produzieren kann. Die Ökonomie — Anschaffungspreise, Strom, Cloud-Stundensätze, API-Listenpreise — entscheidet, ob diese Token auf eigener Hardware oder bei jemand anderem günstiger sind. Diese Seite führt durch beides, mit interaktiven Rechnern, die dieselbe Roofline-Mathematik wie der Inferenzrechner nutzen.
Einstieg: die zwei Ressourcen, die Sie begrenzen
Speicher: der Batch-1-Flaschenhals
Bei geringer Parallelität ist Decode speicherbandbreitenlimitiert. Ein Token zu generieren bedeutet, jeden aktiven Modellparameter einmal aus dem VRAM zu streamen:
Zwei weitere Speichergrenzen kommen hinzu:
- Kapazität: Gewichte + KV-Cache müssen in den VRAM passen. Ein 70B-Modell bei BF16 braucht ~140 GB, bevor ein einziges Token Kontext hineinkommt — keine Consumer-Karte hält das.
- Amortisierungs-Ceiling: Batching verteilt die Gewicht-Lesungen auf mehr Anfragen. Aber jede zusätzliche Sequenz wächst auch den KV-Cache, bis der VRAM voll ist und der Batch nicht mehr wächst.
Rechenleistung: die Ceiling, die Sie im Skalenbetrieb erreichen
Dieselbe GPU hat auch ein hartes FLOPS-Dach. Jedes Token kostet ~2 FLOPs pro aktivem Parameter (Multiplizieren + Akkumulieren), unabhängig von der Quantisierung:
Anders als die Bandbreite ist diese Ceiling batch-unabhängig: Die Gewichte werden pro Decode-Schritt einmal gelesen, egal wie viele Anfragen sie teilen. Batching bewegt Sie auf sie zu; nichts bewegt Sie über sie hinaus.
Wann verschiebt sich die Limitierung vom Speicher zur Rechenleistung?
Pro Anfrage stoppt der Durchsatz-Gewinn, wenn die aggregierte Bandbreiten-Ceiling die Compute-Ceiling erreicht — die Break-Even-Batch-Größe B*. Unter B* reiten weitere Anfragen kostenlos auf denselben Gewicht-Lesungen mit (bei MoE-Modellen ab dem Sättigungs-Batch der Experten-Abdeckung — darunter bleibt der Aggregat-Durchsatz flach); bei B* sättigen die Tensor-Cores; darüber hinaus verwässert jede zusätzliche Anfrage die Geschwindigkeit aller. Für ein dichtes 32B-Modell auf einer RTX PRO 6000 liegt B* um 280; bei MoE-Modellen mit kleinen aktiven Parameterzahlen kann B* im Tausenden liegen. Der Break-Even-Rechner berechnet B* für Ihre genaue Kombination.
Wirtschaftliche Aspekte und Realität
Welche Modelle passen auf welche Hardware?
Passung ist zuerst eine reine Kapazitätsfrage: Gesamtparameter × Bytes pro Parameter müssen Platz für den KV-Cache lassen. Die Matrix unten zeigt es live für Ihre gewählte Präzision und GPU-Anzahl — grün heißt ≥15% Puffer, gelb heißt es passt technisch, aber lässt fast kein KV-Budget, rot heißt es passt nicht. Quantisierung verschiebt ganze Zeilen: FP8 halbiert jeden Gewicht-Footprint, NVFP4 viertelt ihn.
Wie teuer ist die Hardware?
Daumenwerte (Straßen-/Händlerpreise Sept 2026, im Rechner editierbar): eine einzelne RTX PRO 6000 kostet ~8.500 $, H100 ~25.000–30.000 $, H200 ~31.000–40.000 $ (CDW-Einzelkartenlisting ~33.700 $), B200 ~40.000 $ (NVIDIA-Launch-Bandbreite 30.000–40.000 $; Straße 40.000–45.000 $; hauptsächlich in 8-GPU-HGX-Systemen verkauft), B300 ~53.000 $ (Channel-Listings, Juli 2026), MI300X ~12.000 $. Ein kompletter 8-GPU-Server multipliziert die Kartenkosten grob mit 1,8 für Gehäuse, CPUs und Netzwerk. Der Sticker-Preis ist aber nur das Eintrittsticket: Strom (ein 700-W-H100 läuft 24/7 und verbraucht ~504 kWh/Monat — bei 0,25 €/kWh sind das 126 \u20ac, also ~145 $/Monat pro Karte bei EUR/USD ~1,16 im Sept 2026), Housing, Personal und Kapitalkosten verdoppeln die Monatsrechnung über 36 Monate Amortisierung ungefähr.
Wie viele Token bekommen Sie aus der Hardware raus?
Token-Ertrag = Durchsatz am Betriebspunkt (das kleinere von B* und der VRAM-machbaren Batch-Größe) × Wanduhr. Eine RTX PRO 6000, die Qwen3-30B-A3B bei FP8 mit 70% Auslastung serviert, produziert grob 47 Milliarden Token pro Monat; eine B300 — ~4,3× die Bandbreite und ~2,8× der VRAM (7,7 TB/s, 270 GB), sie streamt also schneller UND hält eine viel größere Batch-Größe — erreicht grob 750 Milliarden bei gleichen Einstellungen. Der Rechner berechnet das aus der Roofline — inklusive der Ehrlichkeit, dass die Auslastung, nicht der Peak-Durchsatz, ist, was die meisten Fleet-Betreiber falsch machen.
Wann ist Cloud günstiger — und wann eigene Hardware?
Drei Kostenlinien zählen: Cloud-Miete (pro GPU-Stunde, linear in der Zeit), eigene Hardware (meist fix pro Monat, linear in Token) und APIs (rein pro Token). Die Crossover-Logik:
- Niedrige, spiky Auslastung (< ~40%) → Cloud gewinnt. Sie zahlen nur genutzte Stunden; eigenes Silizium im Leerlauf ist die teuerste Art, nichts zu servieren.
- Konstant hohe Auslastung (> ~60%) mit einem Modell, das passt → eigene Hardware gewinnt um den Faktor 3–10 bei den Rohkosten pro Token. Eine 8.500-$-Karte, die eine 2,20-$/h-Cloud-GPU schlägt, hat sich bei 24/7 in wenigen Monaten bezahlt.
- Sporadische Workloads, viele verschiedene Modelle, kein Ops-Team → APIs gewinnen trotz Token-Aufschlag, weil der Aufschlag Elastizität und null Betrieb kauft.
- Compliance-Grenzen (ISO 27001, C5, DSGVO) → eigene Hardware oder dediziertes Hosting ist oft die einzige Option, unabhängig vom Preis; Daten dürfen das Perimeter nicht verlassen.
Der Rechner berechnet die Crossover-Auslastung und die Break-Even-Monate für Ihre konkrete Workload.
Open-Weight-Modelle vs proprietäre APIs
Die unbequeme Wahrheit für API-Anbieter: Token aus offenen Gewichten sind im Skalenbetrieb dramatisch günstiger. Eine 96-GB-Karte, die ein 30B-Klasse-MoE serviert, kostet ein paar Cent pro Million Token an Strom und Amortisierung; GPT-6 Luna verlangt 0,10/0,50 $ pro Million in/out. Die Tabelle unten stellt jedem Open-Weight-Modell die proprietäre Klasse gegenüber, gegen die es realistisch antritt — gleiche Qualitätsklasse, nicht token-identisch. Zwei Einschränkungen halten es ehrlich: Ihre Zeit für den Betrieb des Stacks ist nicht zu API-Sätzen eingepreist, und die Qualität pro Token unterscheidet sich trotzdem — der Vergleich sagt, was eine Qualitätsklasse kostet, nicht dass die Modelle austauschbar sind.
Ökonomie
Ökonomie der LLM-Inferenz beta
Von der Physik zum Euro: Wie Speicher und Rechenleistung Ihren Durchsatz begrenzen, welches Modell auf welche Hardware passt, was die Hardware kostet und wann Eigentum dem Mieten vorzuziehen ist — inklusive Vergleich mit proprietären API-Preisen.
Token-Ertrag dieser Hardware
Betriebspunkt: min(B*, VRAM-fähiger Batch), FP8-KV, kontinuierliche Bedienung.
Monatliche Kosten bei Eigentum
Anschaffung über 36 Monate amortisiert; Kapitalkosten separat unten ausgewiesen.
Welche Modelle passen auf welche Hardware (FP8 (1 B), 1× GPU)
| Modell | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-4B-Instruct4B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Qwen3-14B14B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Qwen3-32B32,76B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ |
| Qwen3-VL-8B-Instruct8B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| Qwen3-30B-A3B30,5B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ~ | ✓ | ✗ | ✓ |
| Qwen3-Next-80B-A3B80B | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ~ | ~ | ✗ | ✗ | ✗ | ✗ | ~ |
| Qwen3.8-Flash-Next180B | ✓ | ✗ | ~ | ✗ | ✗ | ✓ | ✓ | ~ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| Qwen3.8-27B27B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ~ | ✓ | ✗ | ✓ |
| Qwen3-235B-A22B235B | ~ | ✗ | ✗ | ✗ | ✗ | ✓ | ~ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| Llama 3.3-70B70B | ✓ | ✓ | ✓ | ✓ | ~ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | ✗ | ~ | ✗ | ✓ |
| gpt-oss-120B-A5B117B | ✓ | ✓ | ✓ | ~ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| DeepSeek V3.2-671B-A37B671B | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| DeepSeek V4-Flash-0731284B | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| DeepSeek V4.1-Flash748B | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| GLM-5.2753B | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| Qwen3.6-35B-A3B35B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ |
| Nemotron Nano 9B v28,9B | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
✓ passt mit ≥15 % Puffer für den KV-Cache · ~ passt, aber <15 % Puffer · ✗ überschreitet die Kapazität. Klicken Sie auf eine Spaltenüberschrift, um diese GPU zu wählen. Gewichts-Overhead (3%) eingerechnet. Der KV-Cache-Bedarf wächst mit Kontext und Batch — siehe Planer.
Die gleiche GPU in der Cloud mieten
RTX PRO 6000 (96 GB) — Kleinere Clouds / Managed-Hosts. Die Preise sind bearbeitbare Standardwerte (Sept. 2026); Reserved-/Commit-Preise liegen üblicherweise 40–60 % darunter.
API vs. eigene Hardware für Ihren Workload
API-Listenpreise, Sept. 2026. Open-Weight-Modelle konkurrieren in derselben Klasse, sind nicht token-identisch.
Open-Weight- vs. proprietäre API-Kosten pro 1 Mio. Tokens
Open-Weight-Kosten = eigene Hardwarekosten bei 70% Auslastung, FP8 (1 B) Gewichten, FP8-KV.Die Zuordnungen sind Qualitätsklassen-Vergleiche (z. B. DeepSeek V3.2 ↔ Claude-Opus-Klasse), keine token-identischen Ersatzprodukte.
| Open-Weight-Modell | Proprietäre Klasse | API In/Out ($/Mt | Benötigte GPU-Größe | Eigene $/Mt | API $/Mt (gemischt 30% out | Urteil |
|---|---|---|---|---|---|---|
| Qwen3-32B (dense) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,03 | $0,22 | eigen −85,63% |
| Qwen3-VL-8B-Instruct (dense + vision) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,01 | $0,22 | eigen −97,17% |
| Qwen3-14B (dense) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,01 | $0,22 | eigen −95,05% |
| Qwen3-4B-Instruct (dense) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0 | $0,22 | eigen −98,59% |
| GLM-5.2 (753B-A40B, MLA + DSA) | GPT-5.6 Sol | 4 / 20 | 9× RTX PRO 60 | $0,21 | $8,8 | eigen −97,65% |
| DeepSeek V4.1-Flash (552B-A16B + 196B Engram) | Claude Sonnet 5 | 2 / 10 | 9× RTX PRO 60 | $1,58 | $4,4 | eigen −64,17% |
| DeepSeek V4-Flash-0731 (284B-A13B) | Gemini 3.8 Flash | 0,75 / 3,75 | 4× RTX PRO 60 | $0,26 | $1,65 | eigen −84,03% |
| Qwen3.8-Flash-Next (125B-A6B + PLE + MTP) | Gemini 3.8 Flash | 0,75 / 3,75 | 2× RTX PRO 60 | $0,32 | $1,65 | eigen −80,9% |
| Qwen3.8-27B (dense hybrid) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,02 | $0,22 | eigen −90,45% |
| Qwen3.6-35B-A3B (hybrid MoE + vision) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0 | $0,22 | eigen −98,76% |
| Qwen3-235B-A22B (flagship MoE) | Claude Sonnet 5 | 2 / 10 | 3× RTX PRO 60 | $0,25 | $4,4 | eigen −94,37% |
| Llama 3.3-70B (dense) | Claude Sonnet 5 | 2 / 10 | 1× RTX PRO 60 | $0,23 | $4,4 | eigen −94,77% |
| gpt-oss-120B-A5B (MoE, MXFP4) | GPT-6 Luna | 0,1 / 0,5 | 2× RTX PRO 60 | $0,03 | $0,22 | eigen −87,17% |
| DeepSeek V3.2-671B-A37B (MoE + MLA) | Claude Opus 5.5 | 4 / 20 | 8× RTX PRO 60 | $0,17 | $8,8 | eigen −98,11% |
| Qwen3-Next-80B-A3B (hybrid MoE) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,04 | $0,22 | eigen −83,24% |
| Nemotron Nano 9B v2 (hybrid Mamba) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,01 | $0,22 | eigen −96,85% |
| Qwen3-30B-A3B (MoE) | GPT-6 Luna | 0,1 / 0,5 | 1× RTX PRO 60 | $0,01 | $0,22 | eigen −95,18% |
Alle Preise sind bearbeitbare Standardwerte (Straßen-/Listenpreise von Sept. 2026) — passen Sie sie an Ihre Vertragspreise an. Die Durchsatzzahlen nutzen dieselbe Roofline-Mathematik wie Planer und Break-even-Tool; sie sind theoretische Obergrenzen, und reale Flotten erreichen typischerweise 50–80 % davon. Overhead des Serving-Stacks (vLLM/SGLang), Netzwerk und CPU-seitige Vorverarbeitung sind nicht enthalten.
Verwandte Artikel
- LLM-Inferenzrechner & Break-Even-Analyse — die Batch-Kurve hinter den Kostenlinien.
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive — was entscheidet, ob Ihr Modell auf die kalkulierte Karte passt.
Einschränkungen
- Alle Durchsatzwerte sind Roofline-Obergrenzen; reale Serving-Stacks erreichen 50–80% davon.
- Preise sind editierbare Defaults (Sept 2026 Straßen-/Listenpreise) — tragen Sie Ihre echten Vertragssätze ein.
- Die Open-vs-proprietär-Tabelle ordnet Qualitätsklassen zu; Benchmarks bewegen sich schnell, prüfen Sie gegen Ihre eigenen Evals.
- Serving-Stack-Overhead (vLLM/SGLang-Scheduling, CPU-Preprocessing, Netzwerk) ist nicht modelliert.