flozi00TechHub
Deep Dives zu Servern, GPUs, KI-Infrastruktur und modernen IT-Systemen — praxisnahe Notizen aus echten Projekten.
Dokumentation entdecken
Strukturierte Anleitungen zu Hardware, KI-Infrastruktur, Linux und Netzwerken.
Alles schnell finden
Volltextsuche über alle Guides — inklusive Specs, Konfigurationen und Benchmarks.
im Header — einfach tippen
Nach Thema erkunden
KI-Modelle(2)
Anleitungen(54)
- Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
- BOOST und das Ende des Prefetch: Warum Grace Hopper beide Speichertiere gleichzeitig will
- Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
- CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
- CXMT bei 10 % DRAM-Umsatz: Die DUV-Anatomie eines Aufstiegs und seine EUV-Decke
- DeepSeek-V4.1-Flashs KV-Cache-Kompression, bis ins Byte geprüft: 890 Bytes pro Token sind ein Design, kein Wunder
- Disaggregierte Quantisierung: Prefill- und Decode-Kosten auf zwei Formate verteilen
- FlashLoop, oder: Wer einen Transformer loopt, vervierfacht die Rechnung — und wirft das Meiste wieder weg
- Gumbel-Watermarking ist endlich produktiv — und die Compliance-Asymmetrie, die niemand eingepreist hat
- HBF als dritte KV-Tier: 24x Sessions oder 5x schlechtere Latenz — das Medium ist in Ordnung, die Placement-Politik entscheidet
- KernelOPTs agentische Kernel-Suche: Die Verifikationskaskade funktioniert, der Speedup verblasst mit der Schwierigkeit
- KREX: Kernel-Benchmarking auf geteilten GPUs, ohne die Suche des Agenten zu korrumpieren
- Wer bezahlt den KV-Cache? Messregeln sind getarnte Preisentscheidungen
- Risikokontrollierte KV-Eviction: Der Zuverlässigkeitsvertrag — und der Full-KV-Fallback, den niemand ausliefert
- KITE: Das Modell skalieren, die KV-Rechnung einfrieren — welche Prefill-Invariante arXiv:2609.27294 wirklich beweist (und was nicht)
- KV-Cache-Tensordecomposition: Wo Low-Rank-Kompression mathematisch tot ist (und wo nicht)
- KVSET: Der älteste Trick der Cache-Analyse löst gerade das Prefix-Cache-Sizing für LLMs
- Leaderboard-Margen gegen verborgene Modellauswahl: Welche Gewinne überleben k geheime Varianten?
- Greedy Decoding ist nicht präzisionsinvariant: BF16-vs-FP16-Flips, Margin-Gating und die Kernel-Reihenfolgen-Achse
- Prefix-Eviction: Warum LRU für LLM-Prefix-Caching bereits beinahe optimal ist
- PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird
- Quantisierung bricht Retrieval, während die Genauigkeit hält: Der Top-2-Gap-Test
- Snapdragon X2 unter Linux: Die 80-TOPS-NPU ist nicht die Story — 228 GB/s sind es
- Uncheatable Eval: LLMs benotet nach den Bits, die sie brauchen
- Ihre Agenten-Flotte ist ein Storage-Array: Die KV-Cache-Tiering-Mathematik hinter agentischer Inferenz
- AI-Act Art. 50-Kennzeichnung: Was das Gesetz am 2. Dezember 2026 verlangt — und warum aktuelle Watermarks das (noch) nicht leisten können
- Der Digital Omnibus hat den AI Act nicht ausgesetzt: Was die Verordnung (EU) 2026/1744 wirklich eingefroren hat — und warum der Mittelstand trotzdem in der ersten Prüfungswelle sitzt
- EU AI-Act und DSGVO für selbst gehostete LLMs: Was wirklich gilt
- Warum Parakeet TDT Encoder-Decoder-ASR schlägt
- Random Attention: Wenn KV-Cache-Evictions auf einen Münzwurf treffen und verlieren
- DeepSeek V4 Pro selbst hosten: die echte Rechnung
- GPU-Kaufberatung für LLM-Inferenz (2026)
- Die richtige GPU für Qwen3-Inferenz auswählen
- Der HBM4-Mangel ist ein KV-Cache-Ökonomieproblem, kein Beschaffungsproblem
- Wie LLMs wirklich funktionieren — Eine animierte Tour
- Deutschlands KI-MIG hat den AI Act an die Bundesnetzagentur übergeben — das braucht Ihre Prüfakte, bevor sie fragt
- Der KV-Cache: Exakte Speicher-Mathematik, GQA vs MQA vs MLA und PagedAttention
- KV-Cache-Glossar: jeder Begriff des Serving-Stacks
- llama.cpp / Ollama vs vLLM: Was, wann und warum
- LLM-Inferenz-Mathematik: Theorie trifft Hardware
- LLM-VRAM-Bedarf: Ein mathematischer Deep Dive
- LoRA- und QLoRA-Finetuning: die echte Speicher-Mathematik
- NVIDIA Groq 3 LPX: Die SRAM-Decode-Engine und die Rechnung, die NVIDIA nicht vorführt
- NVIDIA kauft Hugging Face: Die Dependency-Mathematik hinter den 12,93 Mrd. $
- LLM-Quantisierung: Bit-Layouts, Block-Skalen und die VRAM-Mathematik
- RAG-Retrieval-Mathematik: Embedding-Speicher, Vektorindex-Größe und das Latenzbudget, das niemand rechnet
- Expert Parallelism: Das Dilemma des Routers
- Pipeline Parallelism: Daten flussaufwärts pumpen
- Die Churn-Steuer 2026 für Serving-Engines: vLLM 0.29, SGLang 0.5.19 und TensorRT-LLM ohne TensorRT
- UNISON und die pausierte Flotte: Warum Agenten-KV-Traffic jede Cache-Policy bricht
- vLLM vs SGLang: Architektur, Overhead und die Frage, wann man was wählt
- NVIDIA-Treiber auf Ubuntu 24.04: Die nokaslr-Lösung
- Tensor Parallelism: Silizium zerschneiden
- NVIDIA-Treiber, Docker und GPU-Support unter Linux
Hardware & Netzwerke(6)
- AMDs Helios-34x-Behauptung, zerlegt: Wie viel ist Silizium, wie viel Arbeitslast?
- AMD MI300X/MI350/MI400: Mehr Speicher, aber gewinnt die Mathematik? — Eine kritische Silizium-Analyse von AMD Instinct vs NVIDIA
- NVIDIA B200 vs GB200: Effizienz-Benchmark
- MLPerf 2026: Wenn die Software 2,7x wert ist — was misst der Benchmark dann überhaupt?
- NVIDIA NVLink: Hochgeschwindigkeits-GPU-Interconnect
- Scale-up vs Scale-out: Die Netzwerk-Mathematik hinter LLM-Clustern
Neueste Artikel
Wie wir GLM auf B300 in Produktion betreiben: MTP k=5-Tuning
Produktionsnotizen aus dem Betrieb eines GLM-MoE auf 8x B300: die Akzeptanzraten-Mathematik hinter Speculative Decoding, was die gemessene log_stats-Kette ueber k=2-k=3 sagt, und warum NVLS-Fehler default lautlos bleiben.
Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt
Der selbstberichtete Tag mit 44 Agenten, 4 Milliarden Tokens und 1.300 Dollar gegen 80.000 Dollar — Zeile für Zeile gegen live Preislisten nachgerechnet, in Cache-Rabatt, Modell-Spread und Looping-Anteil zerlegt und als Capacity-Planungs-Checkliste für alle aufgebaut, die eine interne Agenten-Flotte betreiben.
BOOST und das Ende des Prefetch: Warum Grace Hopper beide Speichertiere gleichzeitig will
BOOST (arXiv:2609.13592) bis zum Bandbreiten-Ledger zerlegt: Warum Prefetch-Tiering beim Decode strukturell HBM-Schreibbandbreite verbrennt, warum konkurrenter, proportionaler Zugriff die Host-Tier addiert statt stiehlt, die α-Mathematik hinter +31% Durchsatz und 4,3% TPOT bei iso-batch — und der NVLink-C2C-Scope-Guard, der PCIe-x86-Hosts aus der Behauptung heraushält.
Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war
Die Presse erzählte die Geschichte von drei Frontier-Labs, die am 21./22. September 2026 geschlossen die Preise senkten. Die Preislisten sagen etwas anderes: Ein Anbieter senkte Cache-Reads auf 0,05x, einer brachte neue SKUs mit unangetastetem Cache-Multiplizierer, und einer tat gar nichts. Zerlegt bis zur Arithmetik, mit Barrie-förmigen Tageskosten pro Anbieter in Python.
CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts
Ein September-2026-Paper der Sogang University (arXiv:2609.26828) fragt, ob CXL-SSDs NVMe im LLM-Prefix-Caching ersetzen können — und startet mit einem klaren Nein: ein CXL-SSD ohne Anpassung ist rund 3× langsamer als lokales DRAM und nicht schneller als eine NVMe-SSD; ein generischer Next-n-Prefetcher lässt die TTFT praktisch unverändert und verbrennt nur NAND-Bandbreite. Die interessante Hälfte ist die konstruktive: LM-CXD, ein mitgestalteter CXL-SSD, der KV-Chunks zu gerätesichtbaren I/O-Einheiten macht, den NAND-zu-DRAM-Fortschritt an die Serving-Engine meldet, Geräte-DRAM als GPU-zugänglichen Puffer nutzt und lageweise KV-Bewegung unter die GPU-Rechnung pipelint — bis zu 2,6× (compute-asynchron) und 4,03× (lageweise) niedrigere TTFT gegenüber dem Standardgerät, innerhalb von 1,5× zu lokalem DRAM. Dieser Guide kostet jeden Schritt des Interface-Stacks in Bandbreiten- und Latenz-Arithmetik durch, arbeitet heraus, warum CXLs Memory-Semantik Lades nicht gratis macht, warum Prefetching ohne Engine-Wissen spekulieren und verlieren muss — und was unverifiziert bleibt, weil es noch keine CXL-SSD zu kaufen gibt.