Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

LLM-Inferenz-Ökonomie: Kosten & Cloud-Break-Even

Eigenbau vs. Cloud für LLM-Inferenz: Kosten pro Token, Amortisierung und Break-even für GPUs von RTX PRO 6000 bis B300 im Vergleich.

4 Min. Lesezeitflozi00
aigpuinferenceeconomicsclouddeep-learningtoolscalculator

LLM-Serving ist ein Sandwich aus Physik und Ökonomie. Die Physik — Speicherbandbreite, FLOPS, VRAM-Kapazität — begrenzt, wie viele Token eine GPU produzieren kann. Die Ökonomie — Anschaffungspreise, Strom, Cloud-Stundensätze, API-Listenpreise — entscheidet, ob diese Token auf eigener Hardware oder bei jemand anderem günstiger sind. Diese Seite führt durch beides, mit interaktiven Rechnern, die dieselbe Roofline-Mathematik wie der Inferenzrechner nutzen.

Einstieg: die zwei Ressourcen, die Sie begrenzen

Speicher: der Batch-1-Flaschenhals

Bei geringer Parallelität ist Decode speicherbandbreitenlimitiert. Ein Token zu generieren bedeutet, jeden aktiven Modellparameter einmal aus dem VRAM zu streamen:

tok/s≈Speicherbandbreiteaktive Parameter-Bytes\text{tok/s} \approx \frac{\text{Speicherbandbreite}}{\text{aktive Parameter-Bytes}}

Zwei weitere Speichergrenzen kommen hinzu:

  • Kapazität: Gewichte + KV-Cache müssen in den VRAM passen. Ein 70B-Modell bei BF16 braucht ~140 GB, bevor ein einziges Token Kontext hineinkommt — keine Consumer-Karte hält das.
  • Amortisierungs-Ceiling: Batching verteilt die Gewicht-Lesungen auf mehr Anfragen. Aber jede zusätzliche Sequenz wächst auch den KV-Cache, bis der VRAM voll ist und der Batch nicht mehr wächst.

Rechenleistung: die Ceiling, die Sie im Skalenbetrieb erreichen

Dieselbe GPU hat auch ein hartes FLOPS-Dach. Jedes Token kostet ~2 FLOPs pro aktivem Parameter (Multiplizieren + Akkumulieren), unabhängig von der Quantisierung:

tok/smax=FLOPS2×aktive Parameter\text{tok/s}_{\text{max}} = \frac{\text{FLOPS}}{2 \times \text{aktive Parameter}}

Anders als die Bandbreite ist diese Ceiling batch-unabhängig: Die Gewichte werden pro Decode-Schritt einmal gelesen, egal wie viele Anfragen sie teilen. Batching bewegt Sie auf sie zu; nichts bewegt Sie über sie hinaus.

Wann verschiebt sich die Limitierung vom Speicher zur Rechenleistung?

Pro Anfrage stoppt der Durchsatz-Gewinn, wenn die aggregierte Bandbreiten-Ceiling die Compute-Ceiling erreicht — die Break-Even-Batch-Größe B*. Unter B* reiten weitere Anfragen kostenlos auf denselben Gewicht-Lesungen mit (bei MoE-Modellen ab dem Sättigungs-Batch der Experten-Abdeckung — darunter bleibt der Aggregat-Durchsatz flach); bei B* sättigen die Tensor-Cores; darüber hinaus verwässert jede zusätzliche Anfrage die Geschwindigkeit aller. Für ein dichtes 32B-Modell auf einer RTX PRO 6000 liegt B* um 280; bei MoE-Modellen mit kleinen aktiven Parameterzahlen kann B* im Tausenden liegen. Der Break-Even-Rechner berechnet B* für Ihre genaue Kombination.

Wirtschaftliche Aspekte und Realität

Welche Modelle passen auf welche Hardware?

Passung ist zuerst eine reine Kapazitätsfrage: Gesamtparameter × Bytes pro Parameter müssen Platz für den KV-Cache lassen. Die Matrix unten zeigt es live für Ihre gewählte Präzision und GPU-Anzahl — grün heißt ≥15% Puffer, gelb heißt es passt technisch, aber lässt fast kein KV-Budget, rot heißt es passt nicht. Quantisierung verschiebt ganze Zeilen: FP8 halbiert jeden Gewicht-Footprint, NVFP4 viertelt ihn.

Wie teuer ist die Hardware?

Daumenwerte (Straßen-/Händlerpreise Sept 2026, im Rechner editierbar): eine einzelne RTX PRO 6000 kostet ~8.500 $, H100 ~25.000–30.000 $, H200 ~31.000–40.000 $ (CDW-Einzelkartenlisting ~33.700 $), B200 ~40.000 $ (NVIDIA-Launch-Bandbreite 30.000–40.000 $; Straße 40.000–45.000 $; hauptsächlich in 8-GPU-HGX-Systemen verkauft), B300 ~53.000 $ (Channel-Listings, Juli 2026), MI300X ~12.000 $. Ein kompletter 8-GPU-Server multipliziert die Kartenkosten grob mit 1,8 für Gehäuse, CPUs und Netzwerk. Der Sticker-Preis ist aber nur das Eintrittsticket: Strom (ein 700-W-H100 läuft 24/7 und verbraucht ~504 kWh/Monat — bei 0,25 €/kWh sind das 126 \u20ac, also ~145 $/Monat pro Karte bei EUR/USD ~1,16 im Sept 2026), Housing, Personal und Kapitalkosten verdoppeln die Monatsrechnung über 36 Monate Amortisierung ungefähr.

Wie viele Token bekommen Sie aus der Hardware raus?

Token-Ertrag = Durchsatz am Betriebspunkt (das kleinere von B* und der VRAM-machbaren Batch-Größe) × Wanduhr. Eine RTX PRO 6000, die Qwen3-30B-A3B bei FP8 mit 70% Auslastung serviert, produziert grob 47 Milliarden Token pro Monat; eine B300 — ~4,3× die Bandbreite und ~2,8× der VRAM (7,7 TB/s, 270 GB), sie streamt also schneller UND hält eine viel größere Batch-Größe — erreicht grob 750 Milliarden bei gleichen Einstellungen. Der Rechner berechnet das aus der Roofline — inklusive der Ehrlichkeit, dass die Auslastung, nicht der Peak-Durchsatz, ist, was die meisten Fleet-Betreiber falsch machen.

Wann ist Cloud günstiger — und wann eigene Hardware?

Drei Kostenlinien zählen: Cloud-Miete (pro GPU-Stunde, linear in der Zeit), eigene Hardware (meist fix pro Monat, linear in Token) und APIs (rein pro Token). Die Crossover-Logik:

  • Niedrige, spiky Auslastung (< ~40%) → Cloud gewinnt. Sie zahlen nur genutzte Stunden; eigenes Silizium im Leerlauf ist die teuerste Art, nichts zu servieren.
  • Konstant hohe Auslastung (> ~60%) mit einem Modell, das passt → eigene Hardware gewinnt um den Faktor 3–10 bei den Rohkosten pro Token. Eine 8.500-$-Karte, die eine 2,20-$/h-Cloud-GPU schlägt, hat sich bei 24/7 in wenigen Monaten bezahlt.
  • Sporadische Workloads, viele verschiedene Modelle, kein Ops-Team → APIs gewinnen trotz Token-Aufschlag, weil der Aufschlag Elastizität und null Betrieb kauft.
  • Compliance-Grenzen (ISO 27001, C5, DSGVO) → eigene Hardware oder dediziertes Hosting ist oft die einzige Option, unabhängig vom Preis; Daten dürfen das Perimeter nicht verlassen.

Der Rechner berechnet die Crossover-Auslastung und die Break-Even-Monate für Ihre konkrete Workload.

Open-Weight-Modelle vs proprietäre APIs

Die unbequeme Wahrheit für API-Anbieter: Token aus offenen Gewichten sind im Skalenbetrieb dramatisch günstiger. Eine 96-GB-Karte, die ein 30B-Klasse-MoE serviert, kostet ein paar Cent pro Million Token an Strom und Amortisierung; GPT-6 Luna verlangt 0,10/0,50 $ pro Million in/out. Die Tabelle unten stellt jedem Open-Weight-Modell die proprietäre Klasse gegenüber, gegen die es realistisch antritt — gleiche Qualitätsklasse, nicht token-identisch. Zwei Einschränkungen halten es ehrlich: Ihre Zeit für den Betrieb des Stacks ist nicht zu API-Sätzen eingepreist, und die Qualität pro Token unterscheidet sich trotzdem — der Vergleich sagt, was eine Qualitätsklasse kostet, nicht dass die Modelle austauschbar sind.

Ökonomie

Ökonomie der LLM-Inferenz beta

Von der Physik zum Euro: Wie Speicher und Rechenleistung Ihren Durchsatz begrenzen, welches Modell auf welche Hardware passt, was die Hardware kostet und wann Eigentum dem Mieten vorzuziehen ist — inklusive Vergleich mit proprietären API-Preisen.

Token-Ertrag dieser Hardware

Betriebs-Batch-Größe~624
Aggregate Decode-Leistung25.663,79 tok/s
Tokens pro Monat (100 % Auslastung)66.521 M
Tokens pro Monat (bei 70% Auslastung)46.564 M

Betriebspunkt: min(B*, VRAM-fähiger Batch), FP8-KV, kontinuierliche Bedienung.

Monatliche Kosten bei Eigentum

Amortisierte Anschaffung (36 Mon.)$0
Strom (0,46 kW Ø)$82,08
Unterkunft + Personal$100
Sonstige OpEx$50
Gesamt pro Monat$468,19
Davon Kapitalkosten (Leasing/Zinsen)$56,67
Eigene Kosten pro 1 Mio. Tokens$0,01

Anschaffung über 36 Monate amortisiert; Kapitalkosten separat unten ausgewiesen.

Welche Modelle passen auf welche Hardware (FP8 (1 B), 1× GPU)

Modell
Qwen3-4B-Instruct4B✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
Qwen3-14B14B✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
Qwen3-32B32,76B✓✓✓✓✓✓✓✓✓✓✓✗✓✗✓
Qwen3-VL-8B-Instruct8B✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓
Qwen3-30B-A3B30,5B✓✓✓✓✓✓✓✓✓✓✓~✓✗✓
Qwen3-Next-80B-A3B80B✓✓✓✓✗✓✓✓~~✗✗✗✗~
Qwen3.8-Flash-Next180B✓✗~✗✗✓✓~✗✗✗✗✗✗✗
Qwen3.8-27B27B✓✓✓✓✓✓✓✓✓✓✓~✓✗✓
Qwen3-235B-A22B235B~✗✗✗✗✓~✗✗✗✗✗✗✗✗
Llama 3.3-70B70B✓✓✓✓~✓✓✓✓✓✗✗~✗✓
gpt-oss-120B-A5B117B✓✓✓~✗✓✓✓✗✗✗✗✗✗✗
DeepSeek V3.2-671B-A37B671B✗✗✗✗✗✗✗✗✗✗✗✗✗✗✗
DeepSeek V4-Flash-0731284B✗✗✗✗✗✗✗✗✗✗✗✗✗✗✗
DeepSeek V4.1-Flash748B✗✗✗✗✗✗✗✗✗✗✗✗✗✗✗
GLM-5.2753B✗✗✗✗✗✗✗✗✗✗✗✗✗✗✗
Qwen3.6-35B-A3B35B✓✓✓✓✓✓✓✓✓✓✓✗✓✗✓
Nemotron Nano 9B v28,9B✓✓✓✓✓✓✓✓✓✓✓✓✓✓✓

✓ passt mit ≥15 % Puffer für den KV-Cache · ~ passt, aber <15 % Puffer · ✗ überschreitet die Kapazität. Klicken Sie auf eine Spaltenüberschrift, um diese GPU zu wählen. Gewichts-Overhead (3%) eingerechnet. Der KV-Cache-Bedarf wächst mit Kontext und Batch — siehe Planer.

Die gleiche GPU in der Cloud mieten

Cloud-Preis$2,20/h
Cloud monatlich (24/7)$1.584
Cloud monatlich (bei 70% Auslastung)$1.108,8
Cloud-Kosten pro 1 Mio. Tokens$0,02
Own vs cloud per monthEigentum ist $640,61 günstiger
Kreuzungs-Auslastung27,22%

RTX PRO 6000 (96 GB) — Kleinere Clouds / Managed-Hosts. Die Preise sind bearbeitbare Standardwerte (Sept. 2026); Reserved-/Commit-Preise liegen üblicherweise 40–60 % darunter.

API vs. eigene Hardware für Ihren Workload

Monatliches Token-Volumen60 M
Gemini 3.8 Flash API-Kosten pro Monat$99
Eigene Hardware nötig (23,15 tok/s)}1× Setup
Kosten eigener Hardware pro Monat$468,19
Monatliche Ersparnis durch eigene Hardware— (API günstiger)
Break-even (Anschaffung amortisiert)—

API-Listenpreise, Sept. 2026. Open-Weight-Modelle konkurrieren in derselben Klasse, sind nicht token-identisch.

Open-Weight- vs. proprietäre API-Kosten pro 1 Mio. Tokens

Open-Weight-Kosten = eigene Hardwarekosten bei 70% Auslastung, FP8 (1 B) Gewichten, FP8-KV.Die Zuordnungen sind Qualitätsklassen-Vergleiche (z. B. DeepSeek V3.2 ↔ Claude-Opus-Klasse), keine token-identischen Ersatzprodukte.

Open-Weight-ModellProprietäre KlasseAPI In/Out ($/MtBenötigte GPU-GrößeEigene $/MtAPI $/Mt (gemischt 30% outUrteil
Qwen3-32B (dense)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,03$0,22eigen −85,63%
Qwen3-VL-8B-Instruct (dense + vision)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,01$0,22eigen −97,17%
Qwen3-14B (dense)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,01$0,22eigen −95,05%
Qwen3-4B-Instruct (dense)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0$0,22eigen −98,59%
GLM-5.2 (753B-A40B, MLA + DSA)GPT-5.6 Sol4 / 209× RTX PRO 60$0,21$8,8eigen −97,65%
DeepSeek V4.1-Flash (552B-A16B + 196B Engram)Claude Sonnet 52 / 109× RTX PRO 60$1,58$4,4eigen −64,17%
DeepSeek V4-Flash-0731 (284B-A13B)Gemini 3.8 Flash0,75 / 3,754× RTX PRO 60$0,26$1,65eigen −84,03%
Qwen3.8-Flash-Next (125B-A6B + PLE + MTP)Gemini 3.8 Flash0,75 / 3,752× RTX PRO 60$0,32$1,65eigen −80,9%
Qwen3.8-27B (dense hybrid)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,02$0,22eigen −90,45%
Qwen3.6-35B-A3B (hybrid MoE + vision)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0$0,22eigen −98,76%
Qwen3-235B-A22B (flagship MoE)Claude Sonnet 52 / 103× RTX PRO 60$0,25$4,4eigen −94,37%
Llama 3.3-70B (dense)Claude Sonnet 52 / 101× RTX PRO 60$0,23$4,4eigen −94,77%
gpt-oss-120B-A5B (MoE, MXFP4)GPT-6 Luna0,1 / 0,52× RTX PRO 60$0,03$0,22eigen −87,17%
DeepSeek V3.2-671B-A37B (MoE + MLA)Claude Opus 5.54 / 208× RTX PRO 60$0,17$8,8eigen −98,11%
Qwen3-Next-80B-A3B (hybrid MoE)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,04$0,22eigen −83,24%
Nemotron Nano 9B v2 (hybrid Mamba)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,01$0,22eigen −96,85%
Qwen3-30B-A3B (MoE)GPT-6 Luna0,1 / 0,51× RTX PRO 60$0,01$0,22eigen −95,18%

Alle Preise sind bearbeitbare Standardwerte (Straßen-/Listenpreise von Sept. 2026) — passen Sie sie an Ihre Vertragspreise an. Die Durchsatzzahlen nutzen dieselbe Roofline-Mathematik wie Planer und Break-even-Tool; sie sind theoretische Obergrenzen, und reale Flotten erreichen typischerweise 50–80 % davon. Overhead des Serving-Stacks (vLLM/SGLang), Netzwerk und CPU-seitige Vorverarbeitung sind nicht enthalten.

Verwandte Artikel

Einschränkungen

  • Alle Durchsatzwerte sind Roofline-Obergrenzen; reale Serving-Stacks erreichen 50–80% davon.
  • Preise sind editierbare Defaults (Sept 2026 Straßen-/Listenpreise) — tragen Sie Ihre echten Vertragssätze ein.
  • Die Open-vs-proprietär-Tabelle ordnet Qualitätsklassen zu; Benchmarks bewegen sich schnell, prüfen Sie gegen Ihre eigenen Evals.
  • Serving-Stack-Overhead (vLLM/SGLang-Scheduling, CPU-Preprocessing, Netzwerk) ist nicht modelliert.