Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

PTQ-Konfigurationsbewertung: Den Quantisierungspreis vorhalten, bevor das Modell gebaut wird

Ein September-2026-Paper (arXiv:2609.28270) macht Weight-Space-Post-Training-Quantisierung zu einem Pre-Deployment-Auswahlproblem: Jede Layer-Konfiguration bepreist ihre induzierte Output-Fehlerkovarianz mit der downstream-Krümmung des FP-Modells, rho = 1/2 Tr(H Sigma), und eine Trace-Reduktion macht den gesamten Kandidatenkatalog in einem Kalibrierungsdurchlauf bewertbar. Dieser Guide zerlegt das Forward-KL-Preistheorem samt Cancellation-Trick, reproduziert die Trace-Struktur in lauffähigem Python und benennt die ehrlichen Grenzen: nur erste Ordnung, blockdiagonale Krümmung, Kovarianzen, die der Preis nicht sieht.

13 Min. Lesezeitflozi00
aimachine-learningllminferencequantization

Ein September-2026-Paper greift ein Sequenzproblem an, das im Herzen der Weight-Space-Post-Training-Quantisierung (PTQ) liegt: Jede folgenreiche Entscheidung — Finite-Format, Granularität, Quantisierer-Familie, Prä-Quantisierungs-Transformation, Bitbreite — muss getroffen werden, bevor das fertig quantisierte Modell seinen Output-Drift offenbart1. Predicting Quantization Price for Selecting PTQ Configurations Before Deployment (Qiu, Mu, Zhang und Shu, arXiv:2609.28270, cs.CL, eingereicht am 23. September 2026) antwortet mit der Konstruktion eines Preises: Jede zulässige Layer-Konfiguration ist ein Fehlergenerator, der eine Layer-Output-Fehlerkovarianz induziert, und das Full-Precision-Referenzmodell (FP) bepreist diese Kovarianz durch seine downstream-Krümmung,

ρ̂_l(α_l) = 1/2 · Tr(Ĥ_l · Σ̂_l(α_l)),

der erste erhaltene Term einer Forward-KL-Entwicklung, deren linearer Term am Referenzmodell exakt wegfällt1.

Die kritische Einordnung wiegt mehr als die Formel. Das ist kein neuer Quantisierer — das Papier baut keine Rundungsregel, keine Rotation, kein Codebook. Es ist ein Pre-Deployment-Bepreisungsmodell: eine gemeinsame Währung, in der ein 4-Bit-Integer-Skalarformat, eine Group-64-Granularität, eine Hadamard-Rotation und ein Vektor-Codebook gegeneinander gerankt werden können, bevor irgendeines davon deployed ist, inklusive Deployment-Kostenrestriktion1. Wie die HAWQ-Linie der Hessian-bewussten Allokation vorher bepreist es Sensitivität, statt Gewichte zu reparieren2. Der ehrliche Geltungsbereich steht ebenso im Zentrum: Der Preis ist erster Ordnung (quadratisch) im injizierten Fehler, pro Layer gegen eine blockdiagonale Krümmungs-Surrogat bepreist, und gültig nur, wo Effekte höherer Ordnung und Layer-Kopplung klein bleiben — exakt dort, wo die eigene Evidenz des Papiers gesammelt wird und wo seine Selektoren gewinnen1.

Dieser Guide zerlegt die Preiskette — Zieldrift, das Cancellation-Theorem, die dadurch subsumierten Proxy-Reduktionen, die Trace-Score-Abkürzung —, reproduziert die Trace-Struktur in einem lauffähigen Python-Toy, in dem zwei Kandidaten mit identischem Rekonstruktionsfehler um den Faktor neun im Preis auseinanderliegen, und benennt dann die Grenzen: Was erste Ordnung leisten kann und was nicht.

1. Die Entscheidung: Konfigurationen ranken, die man noch nicht gebaut hat

Im Setup des Papiers ist der Deployment-Stack, nicht die Forschung, der Lieferant der Wahlmöglichkeiten. Ein Layer l hat eine zulässige Menge A_l von Konfigurationen α_l — Bitbreite, Granularität, Quantisierer-Familie, Hardware-Format, Prä-Quantisierungs-Transformation oder eine unterstützte Kombination — und Deployment-Kosten κ_l(α_l), die sich in Bits-, Metadaten- und Kernel-Terme zerlegen (κ_bits + κ_meta + κ_kernel). Eine Gesamtkonfiguration α = (α_1, …, α_L) erzeugt das quantisierte Modell mit Output-Verteilung π_α(·|x), und die zu kontrollierende Größe ist die FP-zu-quantisiert Forward-KL-Drift, gemittelt über die Kalibrierungsverteilung:

J(α) = E_x[ KL( π_0(·|x) ‖ π_α(·|x) ) ].

Die ideale Entscheidung ist ein beschränktes Programm: minimiere J(α) unter Σ_l κ_l(α_l) ≤ B. Aber die Auswertung von J(α) erfordert das fertige quantisierte Modell — genau das, was noch nicht existiert. Erschöpfende Deployment-Trials sind meist unmöglich, und die Diagnose des Papiers zur bisherigen Arbeit ist, dass jede Familie nur das von ihr kontrollierte Teil bewertet: Rekonstruktionsmethoden (GPTQ, OBQ, BRECQ, QuIP und Verwandte) reduzieren lokalen Gewichtfehler bei fixierter Geometrie; Hessian-Sensitivitätsmethoden allokieren Präzision bei fixierter Geometrie; Transformationsmethoden (SmoothQuant, AWQ, QuaRot, SpinQuant, Rotationen im QuaRot-Stil) formen jeweils die eigene Koordinate um; End-Loss-Methoden (GuidedQuant, YAQA) bringen Downstream-Loss hinein, aber in der eigenen Schleife1. Fehlt tut ein pre-Deployment-Preis, der Bits, Granularitäten, Codebooks und Transformationen als Instanzen derselben Entscheidung vergleichbar macht1.

Zwei strukturelle Entscheidungen verdienen Hervorhebung. Erstens treten Transformationen als äquivalente Koordinatenwechsel auf: Die Kandidatenkoordinate erfüllt W(α)X(α) = WX exakt in Fließkomma, eine Rotation oder Skalierung ändert also, wo Finite-Format-Fehler entstehen, nicht was der FP-Layer rechnet. Zweitens sind Kosten keine Genauigkeit: κ dokumentiert nur Deploybarkeit (Speicher, Metadaten-Overhead, Online-Kernel), und die Budgetrestriktion entscheidet, welche bepreisten Kandidaten überhaupt erreichbar sind1.

2. Der Preis: Was wegfallen lässt — und warum

Die Herleitung startet von der Forward KL als Funktion eines einzelnen Layer-Outputs z_l, bei sonst auf FP-Referenz gehaltenem Netz. Quantisierung am Layer l erzeugt ein Ersatzgewicht Ŵ_l(α_l) = W_l(α_l) + Δ_l(α_l), das den Fehler Δ_l(α_l) x_l(α_l) am Layer-Output injiziert. Zwei Statistiken bepreisen ihn1:

  • Krümmung (Referenzseite): H_l ist die Erwartung über die Kalibrierungsverteilung der Hesse-Matrix der per-Sample-Forward-KL-Drift nach dem Layer-Output, ausgewertet am Referenz-Output z_l = W_l x_l.
  • Fehlerkovarianz (Kandidatenseite): Σ_l(α_l) = Δ_l(α_l) C_l(α_l) Δ_l(α_l)⊤, wobei C_l die Input-Kovarianz der (ggf. transformierten) Kandidatenkoordinate ist.

Theorem 3.1 stellt dann fest, dass bei dreifacher Differenzierbarkeit des KL-Ziels entlang des Gewichtssegments von der Referenz zum Kandidaten die Drift zerfällt als J(α) = ρ(α) + r(α), mit dem quadratischen Preis ρ(α) = Σ_l ρ_l(α_l) und ρ_l = 1/2 Tr(H_l Σ_l(α_l)), und einem Relativrest r(α), der über einen Term η(α) beschränkt ist, gebaut aus der Lücke zwischen exakter und beibehaltener blockdiagonaler Hesse-Matrix plus einer Ableitungs-beschrankung dritter Ordnung entlang des Störsegments1.

Die Cancellation verdient es, klartextartig benannt zu werden, denn sie ist der ganze Trick. Die Forward KL vom FP-Modell zu jedem perturbierten Modell verschwindet an der Referenz — π_0 gegen π_0 ist null —, und ebenso ihre erste Ableitung in Störungsrichtung: Das FP-Modell ist ein stationärer Punkt der KL zu sich selbst. Die Taylor-Entwicklung um die Referenz hat daher keinen linearen Term; der erste erhaltene Beitrag ist der quadratische. Dieses Quadrat, pro Layer zusammengesetzt, ist exakt 1/2 Tr(H_l Σ_l): Der Kandidat liefert die Kovarianz, die Referenz die Krümmung, die manche Fehlerrichtungen teuer macht. In der Implementierung kann ein PSD-Gauss-Newton-Surrogat H_l ersetzen — das formal bepreiste Objekt bleibt die Kovarianz1.

Dieselbe Struktur-Einsicht trieb schon die HAWQ-Stil-Mixed-Precision: Sensitivität zweiter Ordnung der Lossfläche bestimmt, welche Layer grobe Formate verkraften2 — hier verallgemeinert von einer fixierten Geometrie auf den ganzen Konfigurationskatalog.

3. Was das Papier mit dem Preis kauft: Proxy-Reduktionen als Geschwister, nicht Konkurrenten

Der korrosivste Zug der Preisformel zielt auf Proxies, und er verdient es als Dekomposition gelesen zu werden, nicht als Wettbewerb. Der volle Layer-Preis ist 1/2 Tr(H Δ_W C Δ_W⊤). Substitutionen erzeugen bekannte Scores1:

  • Rekonstruktions-Score (H → I): ρ_rec = 1/2N ‖Δ_W X‖²_F — exakt den mittleren quadratischen Layer-Output-Fehler, den GPTQ-Familien-Objektive minimieren. Er ist der Preis mit fallengelassener downstream-Krümmung.
  • Diagonaler Score (zusätzlich C → diag(C)): ein inputspalten-gewichteter Gewichtfehlerquadrat-Score. Er lässt zusätzlich die Kanal-übergreifende Input-Kovarianz fallen.

Die eigene Charakterisierung des Papiers: Diese Reduktionen erhalten Kandidaten-Rankings nur, wenn die fallengelassenen Faktoren über die verglichene Kandidatenmenge effektiv konstant sind1. Vergleiche zwei Bitbreiten desselben Uniform-Formats in derselben Koordinate, und der Krümmungsfaktor ist konstant — Rekonstruktion genügt. Vergleiche eine Skalierung gegen eine Rotation gegen ein Codebook, und die fallengelassenen Faktoren bewegen sich mit den Kandidaten; die reduzierten Scores schweigen exakt dort, wo ein Konfigurations-Selektor sie bräuchte. Das lauffähige Toy in Abschnitt 5 macht das konkret: zwei Kandidaten mit identischem Rekonstruktions-Score, deren bepreiste Kosten um den Faktor neun auseinandergehen.

Für Finite-Formate wandelt das Papier Formate in die Momente um, die bepreist werden, statt das 4^-b-Bitgesetz als fundamental zu behandeln. Unter der üblichen mittelwertfreien Uniform-Rounding-Hülle gilt für den erwarteten Preis E[ρ̂_l(α_l)] ≤ 1/2 h_l⊤ V_l(α_l) c_l — Diagonale von Krümmung und Input-Kovarianz als Sandwich um die Störmoment-Hülle V_l —, und für einen per-Layer-Uniform-Range r_l spezialisert dies zu E[ρ̂_l(b)] ≤ r_l² / (6 L_b²) · Tr(H_l) Tr(C_l) mit L_b = 2^b − 1. Der 4^-b-Zerfall „ist kein eigenständiges Allokationsgesetz"; er taucht erst auf, nachdem das Format in das bepreiste Störmoment überführt wurde1.

Bei Transformationen wirkt der Koordinatenwechsel P auf beide Faktoren, die der Kandidat kontrolliert: das Quantisierungs-Residuum von W P⁻¹ und die transformierte Input-Kovarianz P C P⊤. Ein sauberes Strukturresultat (Theorem 3.3) bepreist, was voll optimierte affine Vorverarbeitung leisten kann: Unter déterminantenerhaltenden Input-Transformationen ist die kleinste erreichbare Worst-Richtungs-Varianz von P C P⊤ gleich (det C)^(1/n), erreicht exakt durch Whitening1. Und das zwillige Negativresultat erklärt Rotationen: Orthogonales R C R⊤ erhält die Eigenwerte von C, Rotationen können die Input-Metrik also nicht abflachen — sie helfen über das Restresiduum, den Range oder die Kohärenz des transformierten Gewichts. Das referenzseitige H bewegt sich nie.

4. Die Abkürzung: zwei Skalare und ein gecachter Trace

Der Kovarianz-Preis ist die Definition; die eingesetzte Statistik ist billiger. Wenn Koordinate und Störmoment eines Kandidaten nahe isotrop sind (wie nach wirksamen Transformationen), reduziert sich der Preis zu ρ_l ≈ 1/2 σ_l²(α_l) ω_l(α_l) Tr(H_l), wobei σ² die mittlere Input-Varianz in der Kandidatenkoordinate ist, ω die mittlere Störskala von Δ_l, und Tr(H_l) eine referenzseitige Größe, einmal pro Layer gecacht — bei großen Modellen direkt durch einen Hutchinson-artigen PSD-Gauss-Newton-Trace-Schätzer statt durch Formation von Ĥ_l1.

Zu benennen, was diese Reduktion nicht tut: Sie ersetzt H nicht durch eine Identität, wie es die Rekonstruktion tut. Sie hält die Output-Metrik über ihren Trace vor, erst nachdem die Kandidatenseite nahe isotrop gemacht wurde1. Der eingesetzte Score ist dann

ρ̂_l(α_l) = 1/2 · σ̂_l²(α_l) · ω̂_l(α_l) · τ̂_l, τ̂_l = Tr(Ĥ_l),

und der Selektor löst das Budget-Problem min_α Σ_l ρ̂_l(α_l) unter Σ_l κ_l(α_l) ≤ B über die zulässigen Mengen — eine Kalibrierungstabelle von Preisen und Kosten ersetzt teure Modell-Trials, und die fixierte-Geometrie-Bit-Allokation wird nur als Spezialfall zurückgewonnen, in dem Transformation, Familie und Granularität bereits eingefroren wurden1. In unserem Trace-Reduktions-Toy unten liegt das Surrogat bei 4 Bits grob 30 % unter dem Voll-Kovarianz-Preis — die kontrollierten Studien des Papiers zeigen, dass die reduzierte Statistik Ordnungen erhält — um den Preis genau dieser Lücke.

5. Lauffähiges Toy: die Trace-Struktur — und was Rekonstruktion nicht sieht

Die folgende in sich geschlossene Python-Zelle (nur Standardbibliothek, fester Seed, locale-agnostisch) baut einen 4-mal-3-Layer, eine fixe Kalibrierungs-Input-Kovarianz C, eine PSD-downstream-Krümmung H mit einer dominanten Richtung, und zusätzlich zwei Kandidaten, die denselben Layer-Output-Fehler-Betrag injizieren — identische Rekonstruktions-Scores —, einer ausgerichtet an der teuren Krümmungsrichtung, einer orthogonal dazu.

python
import random
 
random.seed(7)
 
# --- a tiny layer: 3 input channels, 4 output channels --------------------
n, m = 3, 4
W = [[random.gauss(0, 1) for _ in range(n)] for _ in range(m)]
X = [[random.gauss(0, 1) for _ in range(200)] for _ in range(n)]  # calibration batch
N = 200
 
# input covariance C = (1/N) X X^T in the reference coordinate
C = [[sum(X[i][k] * X[j][k] for k in range(N)) / N for j in range(n)] for i in range(n)]
 
def uniform_q(bits):
    r = max(abs(w) for row in W for w in row)   # per-tensor range
    s = 2 * r / (2**bits - 1)                   # step size (Eq. 4 style)
    return [[round(W[i][j] / s) * s for j in range(n)] for i in range(m)]
 
def mat_sub(A, B): return [[A[i][j] - B[i][j] for j in range(n)] for i in range(m)]
def trace(A):      return sum(A[i][i] for i in range(len(A)))
def eye(k):        return [[1.0 if i == j else 0.0 for j in range(k)] for i in range(k)]
 
# --- downstream curvature H of the FP reference (PSD: rank-1 + shrinkage) --
d = [random.gauss(0, 1) for _ in range(m)]
H = [[d[i] * d[j] + (0.1 if i == j else 0.0) for j in range(m)] for i in range(m)]
H_diag_only = [[H[i][j] if i == j else 0.0 for j in range(m)] for i in range(m)]
dhat = [x / (sum(x * x for x in d) ** 0.5) for x in d]   # expensive direction
 
def sigma(Delta):  # Sigma_l(alpha) = Delta C Delta^T   (Eq. 7)
    DC = [[sum(Delta[i][k] * C[k][j] for k in range(n)) for j in range(n)] for i in range(m)]
    return [[sum(DC[i][k] * DC[j][k] for k in range(n)) for j in range(m)] for i in range(m)]
 
def price(Hm, Sig):  # rho = 1/2 Tr(H Sigma)  (Eq. 8, layer term)
    HS = [[sum(Hm[i][k] * Sig[k][j] for k in range(m)) for j in range(m)] for i in range(m)]
    return 0.5 * trace(HS)
 
def rec_score(Sig):  # price with H -> I  (Remark 3.2 reconstruction reduction)
    return 0.5 * trace(Sig)
 
print("config |  rho_full   rho_diagH   rho_rec")
for b in (2, 3, 4):
    Sig = sigma(mat_sub(uniform_q(b), W))
    print(f" {b} bits | {price(H, Sig):9.4f}  "
          f"{price(H_diag_only, Sig):9.4f}  {rec_score(Sig):9.4f}")
 
# --- two candidates with about the SAME reconstruction error -------------
# Both are 0.5 * rounding residuals along a chosen output direction:
#   D_bad  aligns its layer-output error with the dominant curvature dhat
#   D_good aligns it with an output direction orthogonal to dhat
ampl = 0.25
# one fixed input-side direction z (rows share it, so the injected error
# has identical Frobenius/C-weighted magnitude for both candidates)
z = [random.gauss(0, 1) for _ in range(n)]
z = [v / (sum(v * v for v in z) ** 0.5) for v in z]
def along(vdir):
    return [[ampl * vdir[i] * z[j] for j in range(n)] for i in range(m)]
ortho = [random.gauss(0, 1) for _ in range(m)]
ortho = [v - sum(o * dh for o, dh in zip(ortho, dhat)) * dh for v, dh in zip(ortho, dhat)]
on = sum(v * v for v in ortho) ** 0.5
ortho = [v / on for v in ortho]
 
D_bad, D_good = along(dhat), along(ortho)
Sig_bad, Sig_good = sigma(D_bad), sigma(D_good)
 
print()
print("candidate |   rho_rec    rho_full   (same-scale injected error)")
print(f"  bad      | {rec_score(Sig_bad):9.4f}  {price(H, Sig_bad):9.4f}")
print(f"  good     | {rec_score(Sig_good):9.4f}  {price(H, Sig_good):9.4f}")
print(" -> reconstruction cannot separate them; the curvature price can")
 
# --- trace reduction (Eq. 18): isotropic surrogate of Sigma at 4 bits -----
Sig4 = sigma(mat_sub(uniform_q(4), W))
rho_trace = 0.5 * (trace(Sig4) / m) * trace(H)
print(f"\n4-bit full-covariance price {price(H, Sig4):.4f} "
      f"vs trace-reduced price {rho_trace:.4f}")

Ausgabe eines echten Laufs (Python 3, Seed 7):

text
config |  rho_full   rho_diagH   rho_rec
 2 bits |    0.1118     0.1298     0.5080
 3 bits |    0.0156     0.0141     0.0536
 4 bits |    0.0072     0.0049     0.0170
 
candidate |   rho_rec    rho_full   (same-scale injected error)
  bad      |    0.0390     0.0347
  good     |    0.0390     0.0039
 -> reconstruction cannot separate them; the curvature price can
 
4-bit full-covariance price 0.0072 vs trace-reduced price 0.0051

Drei Lesarten. Erstens staucht die Bitleiter den vollen Preis von 2 auf 4 Bits um grob den Faktor 15 und den Rekonstruktions-Score um grob 30 — die Verhältnisse benachbarter Formate überleben den Proxy hier, weil der Krümmungsfaktor über Bitbreiten konstant ist, exakt das Regime, in dem das Papier Reduktionen für sicher erklärt. Zweitens ist das bad/good-Paar das Argument des Papiers in zwei Zahlen: identische Rekonstruktions-Scores von 0.0390, bepreiste Kosten von 0.0347 gegenüber 0.0039 — Faktor neun, sichtbar nur für den Krümmungsfaktor, und genau das braucht das Ranking verschiedener Konfigurationsfamilien (nicht nur Bits). Drittens unterbepreist das Trace-Reduktions-Surrogat den 4-Bit-Kandidaten in diesem bewusst anisotropen Toy um grob 30 % (0.0051 vs. 0.0072) — exakt die Klasse von Lücken, weshalb das Papier die Alignment der reduzierten Statistik separat ausweist, statt sie anzunehmen.

6. Die Evidenz: Rankt der Preis Konfigurationen vor dem Deployment korrekt?

Das Papier testet die Vorhersagekette in derselben Reihenfolge, in der sie gebaut wird1.

Preis folgt der KL-Drift (Abschnitt 4.1). Auf OPT-125M und Qwen3-0.6B, unter kontrollierten Ein-Layer-Störungen über drei Whitening-Transformationstypen, die No-Transformation-Baseline, Bitbreiten und Granularitäten, korreliert der realisierte Preis (die Voll-Kovarianz 1/2 Tr(H Σ)) mit der gemessenen FP-zu-quantisiert-KL-Drift bei ρ = 0.9470 (OPT-125M) und ρ = 0.9249 (Qwen3-0.6B). Der eingesetzte Trace-Preis — die tatsächlich verwendete Zwei-Skalare-Plus-Ge-Cache-Trace-Statistik — hält fast dasselbe Alignment bei ρ = 0.9483 und ρ = 0.9438. Eine Zwei-Layer-Variante (Preis summiert über einen perturbierten Layer plus einen zweiten Layer mit anderem Kandidaten) folgt der Drift ebenfalls, was die lokale Dekomposition über Layer im kontrollierten Regime stützt1.

Preisgeführte Selektion (Abschnitt 4.2, Llama-3.2-1B, WikiText2-PPL; 112 quantisierte Linear-Layer). Drei Konfigurationsklassen, ein Selektor1:

  • Bit-Allokation (Bits aus bei 3.0 Bits Zielmittel): Der preisgeführte Selektor braucht 579 Sekunden und landet bei PPL 12.22 mit dem besten durchschnittlichen Downstream-Score der drei 3-Bit-Methoden (51.24). HIGGS braucht 813 s für 12.50 / 50.57; AMQ erreicht die beste PPL (11.05), aber mit 11.635 s — es baut und evaluiert quantisierte Modelle pro Kandidaten-Allokation. Das Papier sagt ausdrücklich, dass AMQs Allokation auf PPL besser ist; der Claim ist Wettbewerbsfähigkeit bei grob 20-fach niedrigeren Selektionskosten1.
  • Transformations-Selektion (Quantisierer fix, zulässige Prä-Quantisierungs-Transformationen): Preisführung wählt die beste PPL (11.53) und den besten Schnitt-Score (49.82) in 657 s, gegen CALM-CKA bei 12.80 PPL und Random-Selektion, die auf 22.68 kollabiert1.
  • Granularitäts-Allokation (Skala, auf der Gewichte Quantisierungsparameter teilen): beste PPL (11.39) und bester Schnitt-Score (51.96) in 127 s, gegen fixiertes Group-128 bei 12.71 und Random bei 23.313 PPL1.

Anhang C wiederholt das Protokoll auf Llama-3.2-3B und Llama-3.1-8B, mit haltendem Bild bei 3B (Transformations-Selektion: PPL von 8.81 auf 8.58 gegenüber CALM-CKA, Schnitt-Score 58.58 auf 58.96) und durchwachsenerem bei 8B (PPL 6.97 auf 6.86, aber Schnitt-Score 64.18 für CALM-CKA gegenüber 64.24 — eine Rundungsfehler-Marge — und AMQ stärker im gesamten 8B-Bit-Allokations-Block)1. Zur Einordnung der FP-Baselines: Llama-3.2-1B FP16 liegt bei PPL 9.75, jede deployte Konfiguration zahlt also eine Drift-Distanz, die der Preis vor dem Commit vorhersagen soll.

7. Anti-Hype: Was erste Ordnung bepreisen kann — und was nicht

Das Papier ist auf Weight-Space-PTQ begrenzt und sagt das; die Grenzen sind der nützliche Teil1.

Nur erste Ordnung, und der Rest ist als Diagnostik bepreist, nicht kontrolliert. Der quadratische Preis ist exakt bis zum Rest r(α), relativ beschränkt über η(α) — was sowohl Lücke zwischen exakter und blockdiagonaler Hesse-Matrix als auch eine dritte Ableitung entlang des Segments enthält. In aggressiven Low-Bit-Regimen nennt das Papier Low-Bit-Nichtlokalität und Momenten-Modell-Mismatch als Effekte, die definieren, wo der Prädiktor gültig ist; in das Ziel gehen sie nicht ein. Wer den Selektor bei 2-3 Bits oder auf Outlier-lastigen Layern einsetzt, erbt das unbepreiste Residuum.

Layer-Kopplung ist eine Modellierungsentscheidung, keine Schätzung. Der Preis summiert blockdiagonale Layer-Terme; Kopplung zwischen Layern erscheint in derselben Regime-Liste. Das Zwei-Layer-Experiment stützt Additivität unter kontrollierten, kleinen Störungen — nicht der Nachweis, dass Kopplungen zweiter Ordnung bleiben, wenn alle L Layer gleichzeitig quantisiert sind, was die Deployed-Bedingung ist. Dass die Selektion end-to-end trotzdem funktioniert (Abschnitt 6), ist die praktische Antwort; ein Abrechnen der Interaktionsverluste pro Tier enthält das Papier nicht.

Die Kovarianz ist ein modelliertes Moment, nicht die deployte Verteilung. Σ_l kommt aus einer Rounding-Hüllen-Erwartung (δ²/12 pro Gruppe, die Momenten-Hülle V_l für Codebooks), nicht aus den echten Outputs des quantisierten Modells — die existieren ja per Konstruktion noch nicht. Wenn reale Rundungsfehler über Einträge oder mit Inputs korrelieren — Outlier-Struktur, Interaktion mit gelernten Transformationen, Kernel-Level-Clipping —, fallen bepreiste Kovarianz und realisierte Drift auseinander. Das Papier nennt Krümmungs-Proxy-Fehler (GN-Surrogat statt echter Hesse-Matrix) in derselben Regime-Liste.

Die Korrelations-Decke. ρ ≈ 0.92-0.95 in kontrollierten Ein-Layer-Studien ist starke Surrogat-Qualität, keine Identität: grob 10 bis 19 % der Varianz der KL-Drift bleiben selbst vom realisierten Preis unerklärt. Und der Geltungsbereich ist Weight-Space-PTQ — Aktivierungs-Quantisierung, KV-Cache-Quantisierung, Runtime-Clipping und QAT liegen außerhalb des Selektors, solange ihre Effekte nicht als Pre-Deployment-Output-Fehlerkovarianz plus Kosten exponiert werden, was das Papier als Verzweigungs-Konsequenz führte, nicht als getestete Erweiterung1.

Die Frage an einen Vendor, der dieses Framing übernimmt: Welche Statistik wird berichtet — der realisierte Kovarianz-Preis oder der Trace-reduzierte Score mit seiner Isotropie-Annahme — und wo waren die fallengelassenen Faktoren über die tatsächlich gerankte Kandidatenmenge nicht konstant?

8. Fazit

Der Beitrag ist eine Entscheidungsprozedur, und das Papier verkauft sie als solche: ein aus der Forward KL hergeleiteter Preis, der Formate, Granularitäten, Familien, Transformationen und Bits vor dem Deployment vergleichbar macht, reduzierbar auf zwei kandidatenseitige Skalare und einen gecachten referenzseitigen Trace pro Layer, beschränkt durch ehrliche Deployment-Kosten. Die Proxy-Dekompwosition ist der intellektuell dauerhafteste Teil — Rekonstruktions- und diagonale Scores werden zu exakt identifizierten Reduktionen des Preises, mit einer klaren Bedingung (konstante fallengelassene Faktoren), wann sie sicher sind. Der empirische Teil ist stark, wo er kontrolliert ist (Ein-Layer-Störungs-Alignment), und ehrlich gemischt, wo es kommerziell zählt (AMQ schlägt den Preis bei 8B auf PPL; der Preis gewinnt die Selektionskosten um eine Größenordnung). Wie jedes Bepreisungsmodell erster Ordnung ist er eine billige Schätzung einer Drift, die man noch nicht messen kann — und die richtige Antwort darauf ist die des Papiers selbst: das Betriebsregime benennen, das Alignment der reduzierten Statistik separat ausweisen und niemals den Preis mit der Rechnung verwechseln.

Footnotes

Footnotes

  1. Qiu, Junbin; Mu, Jian; Zhang, Weitong; Shu, Yao — Predicting Quantization Price for Selecting PTQ Configurations Before Deployment, arXiv:2609.28270, cs.CL, eingereicht am 23. September 2026 (vollständiges HTML v1 verifiziert: Konfigurations-Selektions-Formulierung mit Kosten κ = κ_bits + κ_meta + κ_kernel und Forward-KL-Ziel Gl. 2-3; Thm. 3.1 quadratischer Preis rho_l = 1/2 Tr(H_l Sigma_l) mit Wegfall erster Ordnung an der FP-Referenz und Rest-Beschränkung über blockdiagonale Hesse-Lücke plus dritte Ableitung, Gl. 8-9; Remark 3.2 Rekonstruktion = H->I = 1/2N ||Delta_W X||_F^2 und diagonal = C->diag(C) Reduktionen, ranking-sicher nur bei konstanten fallengelassenen Faktoren; Gl. 10-11 Momenten-Schranke E[rho] ≤ 1/2 h^T V c und 4^-b-Gesetz E[rho_l(b)] ≤ r_l^2/(6 L_b^2) Tr(H)Tr(C), L_b = 2^b - 1; Thm. 3.3 Whitening-Optimum lambda_g = (det C)^(1/n) unter determinanten-erhaltenden Affinen, Rotationen erhalten Eigenwerte von C; Trace-Reduktion Gl. 16-18 mit tau = Tr(H) über Hutchinson-artigen PSD-Gauss-Newton-Trace-Schätzer; Abschn. 4.1 OPT-125M rho = 0.9470 / 0.9249 und Qwen3-0.6B Trace-Preis 0.9483 / 0.9438 Korrelationen über Whitening- Transformationen, Bits, Granularitäten, inkl. Zwei-Layer-Variante; Abschn. 4.2 Llama-3.2-1B, 112 quantisierte Linear-Layer: Bit-Allokation 579 s / PPL 12.22 / Schnitt 51.24 vs HIGGS 813 s / 12.50 / 50.57 und AMQ 11.635 s / 11.05 / 50.13, Bits bei 3.0 Mittel, FP16 PPL 9.75; Transformations-Selektion 657 s / 11.53 / 49.82 vs CALM-CKA 12.80 / 49.20, Random 22.68; Granularität 127 s / 11.39 / 51.96 vs Group-128 12.71, Random 23.313; Anhang C Llama-3.2-3B 8.81->8.58 PPL und 58.58->58.96 Schnitt, Llama-3.1-8B 6.97->6.86 PPL, 64.18 vs 64.24 Schnitt, AMQ stärker bei 8B, 112/196/224 Layer für 1B/3B/8B; Geltungsbereich: Weight-Space-PTQ, Regime erster Ordnung lokal momenten-stabil, Layer-Kopplung und Krümmungs-Proxy-Fehler als Regime-Grenzen): https://arxiv.org/abs/2609.28270 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24 ↩25 ↩26

  2. Die Hessian-Sensitivitäts-Linie, die das Papier verallgemeinert: Dong, Zhen; Yao, Zhewei; Gholami, Amir; Mahoney, Michael W.; Keutzer, Kurt — HAWQ: Hessian AWare Quantization of Neural Networks with Mixed-Precision, arXiv:1905.03696, ICCV 2019, sowie Dong, Zhewei; Yao, Zhewei; Cai, Yizhong; Arfeen, Dilin; Gholami, Amir; Mahoney, Michael W.; Keutzer, Kurt — HAWQ-V2: Hessian Aware Trace-Weighted Quantization of Neural Networks, arXiv:1911.03852 — Sensitivitätssignale zweiter Ordnung (Hessen-Spektrum) für Mixed-Precision-Allokation bei fixierter Quantisierungsgeometrie, vom Papier als fixierte-Geometrie-Referenzen zitiert, die das Konfigurations-Selektions-Framing subsumiert (Anmerkung: Die Referenzliste des Papiers gibt diese beiden arXiv-IDs an; die kursierende HAWQ-V3-Zitation der 2306er-Serie löst auf ein anderes Papier auf): https://arxiv.org/abs/1905.03696 ↩ ↩2