Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.
Wissensdatenbank

flozi00TechHub

Deep Dives zu Servern, GPUs, KI-Infrastruktur und modernen IT-Systemen — praxisnahe Notizen aus echten Projekten.

Dokumentation entdecken

Strukturierte Anleitungen zu Hardware, KI-Infrastruktur, Linux und Netzwerken.

Alles schnell finden

Volltextsuche über alle Guides — inklusive Specs, Konfigurationen und Benchmarks.

im Header — einfach tippen

Nach Thema erkunden

Anleitungen(54)

Neueste Artikel

5 Min. Lesezeit

Wie wir GLM auf B300 in Produktion betreiben: MTP k=5-Tuning

Produktionsnotizen aus dem Betrieb eines GLM-MoE auf 8x B300: die Akzeptanzraten-Mathematik hinter Speculative Decoding, was die gemessene log_stats-Kette ueber k=2-k=3 sagt, und warum NVLS-Fehler default lautlos bleiben.

llm-inferenzspeculative-decodingmtpb300
11 Min. Lesezeit

Agent-Fleet-Tokenökonomie ist Cache-Ökonomie: Der 60-fache Dollar-Spread im Detail zerlegt

Der selbstberichtete Tag mit 44 Agenten, 4 Milliarden Tokens und 1.300 Dollar gegen 80.000 Dollar — Zeile für Zeile gegen live Preislisten nachgerechnet, in Cache-Rabatt, Modell-Spread und Looping-Anteil zerlegt und als Capacity-Planungs-Checkliste für alle aufgebaut, die eine interne Agenten-Flotte betreiben.

aimachine-learningllminference
13 Min. Lesezeit

BOOST und das Ende des Prefetch: Warum Grace Hopper beide Speichertiere gleichzeitig will

BOOST (arXiv:2609.13592) bis zum Bandbreiten-Ledger zerlegt: Warum Prefetch-Tiering beim Decode strukturell HBM-Schreibbandbreite verbrennt, warum konkurrenter, proportionaler Zugriff die Host-Tier addiert statt stiehlt, die α-Mathematik hinter +31% Durchsatz und 4,3% TPOT bei iso-batch — und der NVLink-C2C-Scope-Guard, der PCIe-x86-Hosts aus der Behauptung heraushält.

aimachine-learninggpugpu-memory
9 Min. Lesezeit

Der Cache-Read-Preiskrieg des Septembers 2026, der nicht dreiseitig war

Die Presse erzählte die Geschichte von drei Frontier-Labs, die am 21./22. September 2026 geschlossen die Preise senkten. Die Preislisten sagen etwas anderes: Ein Anbieter senkte Cache-Reads auf 0,05x, einer brachte neue SKUs mit unangetastetem Cache-Multiplizierer, und einer tat gar nichts. Zerlegt bis zur Arithmetik, mit Barrie-förmigen Tageskosten pro Anbieter in Python.

aimachine-learningllminference
18 Min. Lesezeit

CXL-SSDs für LLM-Prefix-Caching: Byte-Adressierbarkeit bringt ohne Chunk-Bewusstsein nichts

Ein September-2026-Paper der Sogang University (arXiv:2609.26828) fragt, ob CXL-SSDs NVMe im LLM-Prefix-Caching ersetzen können — und startet mit einem klaren Nein: ein CXL-SSD ohne Anpassung ist rund 3× langsamer als lokales DRAM und nicht schneller als eine NVMe-SSD; ein generischer Next-n-Prefetcher lässt die TTFT praktisch unverändert und verbrennt nur NAND-Bandbreite. Die interessante Hälfte ist die konstruktive: LM-CXD, ein mitgestalteter CXL-SSD, der KV-Chunks zu geräte­sichtbaren I/O-Einheiten macht, den NAND-zu-DRAM-Fortschritt an die Serving-Engine meldet, Geräte-DRAM als GPU-zugänglichen Puffer nutzt und lageweise KV-Bewegung unter die GPU-Rechnung pipelint — bis zu 2,6× (compute-asynchron) und 4,03× (lageweise) niedrigere TTFT gegenüber dem Standardgerät, innerhalb von 1,5× zu lokalem DRAM. Dieser Guide kostet jeden Schritt des Interface-Stacks in Bandbreiten- und Latenz-Arithmetik durch, arbeitet heraus, warum CXLs Memory-Semantik Lades nicht gratis macht, warum Prefetching ohne Engine-Wissen spekulieren und verlieren muss — und was unverifiziert bleibt, weil es noch keine CXL-SSD zu kaufen gibt.

aimachine-learningllminference