Zum Inhalt springen
Kurzer Hinweis: flozi00 TechHub ist ein Solo-Nebenprojekt neben einem Vollzeitjob — persönliche Lernnotizen, keine offiziellen Aussagen. Kritische Schritte selbst prüfen.

Leaderboard-Margen gegen verborgene Modellauswahl: Welche Gewinne überleben k geheime Varianten?

Nicht „Leaderboards sind nutzlos.“ arXiv:2609.28177 zerlegt: das Gauße Margenmodell hinter Hidden-Selection-Sensitivitätskurven, warum die benötigte Schwelle von z=1,645 Richtung 2,7 wächst, je mehr Varianten k bei rho_w=0,56 umfasst, warum die Korrelation zum gerankten Score passen muss (0,90 gepoolt vs 0,46 Item-Resampling vs 0,92 Subject-Resampling), und das 394-Claims-Audit, das 391 ohne statistische Unterstützung findet — bevor Selektion überhaupt eingeht. Mit Simulation.

9 Min. Lesezeitflozi00
aimachine-learningllmevaluationleaderboards

Wenn ein Lab einen Zwei-Punkte-Sieg auf einem öffentlichen LLM-Leaderboard posted, ist die teuerste Annahme im Raum, dass der sichtbare Score auch der Score war, den sie intern gemessen haben. Meist ist er es nicht. Ein Provider bewertet privat eine bestimmte Anzahl von Varianten, shipped die beste, und das Board zeigt diesen Champion neben einem festen Comparator. Die publizierte Marge ist ein Maximum über eine private Familie, keine einzelne Ziehung. Ein Statistik-Preprint vom September 2026, „How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?“ (Chen Yang, Xianyang Zhang und Jun Chen, arXiv:2609.28177)1, nimmt diesen Mechanismus ernst und leitet her, was er mit Leaderboard-Claims macht — und die Antwort ist präziser und nützlicher als das übliche „Leaderboards sind verrauscht“-Achselzucken.

Der getestete Claim ist nicht der, den man denkt

Das Paper formalisiert ein Setup mit drei fixierten Objekten: Ein Provider scored intern k Geschwister-Varianten, reicht die beste ein, und das Board zeigt den eingereichten Score neben einem öffentlichen Comparator, mit Item-weiser Korrektheit für beide angezeigten Modelle. Das statistische Ziel ist die Provider-Level-Nullhypothese: keine versteckte Variante schlägt den Comparator wirklich. Eine Verwerfung zertifiziert, dass irgendeine Variante des Providers genuin besser ist — nicht unbedingt die Eingereichte2. Die verlorenen Geschwister, ihre Anzahl k und ihre Korrelation untereinander werden nie öffentlich. Das Audit kann daher die Suchgröße nicht schätzen; es kann nur die Umkehrfrage stellen: Welche Anzahl versteckter Varianten kann der beobachtete Claim absorbieren und weiter standhalten?

Diese Umkehrfrage macht das Paper nützlich. Statt eines Urteils („Lab X hat geschummelt“) gibt es eine Sensitivitätskurve: für jede angenommene untere Schranke der Korrelation innerhalb der Familie die größe Anzahl versteckter Varianten, die die Marge noch zertifiziert. Die Kurve verwandelt eine Unbeobachtbare — die private Suchgröße — in eine Familie expliziter Annahmen, mit denen man diskutieren kann.

Das Gauße Margenmodell in einem Akt

Scores sind asymptotisch Gauß-verteilt und koppeln über Item-Korrektheit. Das Arbeitsmodell hat drei Komponenten: eine Item-Schwierigkeit, die jedes Modell teilt (sie kündigt sich in jeder Marge weg), eine Familienkomponente, die die Geschwister teilen (das macht sie ähnlich), und idiosynkratisches Rauschen (das nimmt zu, wenn man ein Maximum selektiert). Standardisiert korrelieren Varianten-Scores paarweise bei rho_w, Varianten mit dem Comparator bei rho_b. Margen — Variante minus Comparator — haben dann Varianz 2*(1-rho_b) und paarweise Korrelation r = (1+rho_w-2rho_b) / (2-2rho_b)3.

Der Worst Case für einen Auditor ist der, in dem jedes versteckte Geschwister exakt so gut ist wie der Comparator: schlechtere Geschwister tragen weniger zum Maximum bei, bessere machen die Nullhypothese falsch. In dieser least-favorable Konfiguration hat die Tail des Maximums die klassische Ein-Faktor-Dunnett-Form (Dunnett, 1955) — die k-te Potenz eines bedingten Tails, gemittelt über einen geteilten Gaußfaktor4. Daraus entsteht das Zertifikat: Für die beobachtete standardisierte Marge z liefert die Kurve die größe versteckte Multiplizität, die der Claim auf Signifikanzniveau alpha übersteht. Das Paper illustriert mit k-bar(0,56) = 17: Der Claim ist für bis zu 17 versteckte Varianten zertifiziert, wenn jedes Geschwisterpaar mit mindestens 0,56 korreliert. Bei 27 Varianten ist er es nicht — unabhängig davon, was der Provider tatsächlich gemacht hat.

Wie das Maximum die Signifikanz auffrisst

Die Intuition lässt sich billig simulieren. Man erzeugt k Gaußsche Varianten mit Familien-Korrelation rho_w unter der Null (alle Mittelwerte gleich dem Comparator), nimmt das Maximum und vergleicht es mit der naiven Einzeltest-Schwelle von 5 Prozent (z = 1,645). Bei k=1 liegt die Falsch-Zertifizierungsrate exakt bei 5 Prozent. Dort bleibt sie nicht:

python
import numpy as np, math
from math import erf, sqrt, log
 
def ppf(p, lo=-10, hi=10):        # normal quantile by bisection, no scipy needed
    for _ in range(80):
        mid = (lo + hi) / 2
        if 0.5*(1 + erf(mid/sqrt(2))) < p: lo = mid
        else: hi = mid
    return (lo + hi) / 2
 
rho_b = 0.5                       # comparator correlation (paper default)
naive = ppf(0.95)                 # k=1 threshold: 1.645
def sim(k, rho_w, rho_b=0.5, n=400_000, rng=None):
    rng = rng or np.random.default_rng(7)
    r = (1 + rho_w - 2*rho_b) / (2 - 2*rho_b)   # margin correlation
    G = rng.standard_normal(n)                 # shared family factor
    E = rng.standard_normal((n, k))            # idiosyncratic noise
    m = np.sqrt(r)*G[:, None] + np.sqrt(1-r)*E # unit-variance margins
    return m.max(axis=1) * sqrt(2*(1-rho_b))   # rescale to margin units
 
print(f"naive (k=1) 5% threshold: z = {naive:.3f}")
print("false-certification rate if k hidden variants exist, rho_w = 0.56:")
for k in [1, 5, 27, 100]:
    print(f"  k={k:3d}: {(sim(k, 0.56) > naive).mean():.3f}")
print("threshold the auditor needs at k=27 (95th pct of the max):")
for rho_w in [0.92, 0.71, 0.56, 0.42]:
    q95 = np.quantile(sim(27, rho_w, n=1_000_000,
                       rng=np.random.default_rng(42)), 0.95)
    z = q95 / sqrt(2*(1-rho_b))
    p1 = 0.5*(1 + erf(z/sqrt(2)))              # single-variant tail at that z
    ne = log(0.95) / log(p1)                   # independent-equivalent count
    print(f"  rho_w={rho_w:.2f}: needed z = {z:.2f}  (behaves like ~{ne:.0f} free tries)")
text
naive (k=1) 5% threshold: z = 1.645
false-certification rate if k hidden variants exist, rho_w = 0.56:
  k=  1: 0.050
  k=  5: 0.158
  k= 27: 0.347
  k=100: 0.507
threshold the auditor needs at k=27 (95th pct of the max):
  rho_w=0.92: needed z = 2.16  (behaves like ~3 free tries)
  rho_w=0.71: needed z = 2.54  (behaves like ~9 free tries)
  rho_w=0.56: needed z = 2.68  (behaves like ~14 free tries)
  rho_w=0.42: needed z = 2.78  (behaves like ~19 free tries)

Drei Dinge fallen ab. Erstens: Die Erosion ist schnell, aber nicht katastrophal — 27 versteckte Varianten bei Korrelation 0,56 verhalten sich wie rund 14 unabhängige Versuche, nicht wie 27. Die Familienkomponente bindet die Geschwister zusammen, sie kaufen dem Provider also weniger freie Lottoscheine als unabhängige Versuche5. Zweitens: Die benötigte Marge ist systematisch, kein Klippen-Phänomen — bei den Ankern des Papers braucht ein Adjacent-Rank-Claim bei k=27 und Korrelationsschranken 0,42–0,56 ein z um 2,7 statt 1,645; eine Toleranz, die die meisten adjazenten Leaderboard-Paare schlicht nicht haben. Drittens: Der naive 5-Prozent-Test degradiert in eine spezifische, quantifizierbare Richtung — bei k=100 und rho_w=0,56 bringt die Hälfte reiner Rausch-Champions die unangetastete Schwelle noch hinter sich. Das eigene Effektiv-Multiplizitäts-Raster des Papers spannt bei k=27 n_eff = 5–19 über seine Szenarien — die Simulation hier landet in diesem Band.

0,90, 0,46, 0,92: Die Korrelation muss zum gerankten Score passen

Hier liegt der Teil, den die meisten Berichte verhunzen. Das Zertifikat ist über die Korrelation des Scores indiziert, nach dem das Board tatsächlich rankt — und das ist nicht die Korrelation, die man naiv messen würde. Der Open LLM Leaderboard rankt nach dem gleichgewichteten Mittel aus sechs Benchmark-Accuracies. Unter Item-Resampling innerhalb der Benchmarks skaliert der Varianzanteil eines Benchmarks am Composite mit 1/n_b — der Anzahl der Items —, während eine über alle Items gepoolte Korrelation jeden Benchmark nach seinem Item-Anteil gewichtet. Die beiden Schätzer beantworten verschiedene Fragen6.

Das Arbeitsbeispiel des Papers macht es konkret: In einer kontrollierten Qwen2.5-1.5B-Full-Fine-Tune-Familie auf MMLU + GSM8K liefert GSM8K nur 8,6 Prozent der Items, treibt aber rund 91 Prozent der Sampling-Varianz des Zwei-Task-Scores. Item-Pooling betont MMLU und liefert eine Familien-Korrelation (Median) von 0,894; score-gematchtes Item-Resampling betont GSM8K und liefert 0,459. Dieselben Modelle, dieselben Items, derselbe Lauf — ein anderer Estimand. In 4 von 12 handkuratierten Beobachtungsfamilien widersprechen sich die zwei Schätzungen sogar darin, welche Familie stärker korreliert.

Die 0,92 ist der dritte Punchline: Resampelt man MMLUs 57 Subjects als ganze Blöcke statt als Items — bei item-gewichtetem Score —, springt der score-gematchte Median der Arbeitsfamilie von 0,459 auf 0,9217. Der Kontrast pooled vs score-gematcht ist also konditional aufs Sampling-Modell — „was variiert zwischen hypothetischen Re-Evaluierungen?“ entscheidet, welche Korrelation überhaupt relevant ist. Keine dieser drei Zahlen ist die Korrelation; jede ist korrekt unter einem benannten Resampling-Schema, und nur die score-gematchte unter Item-Resampling passt zu dem, wonach dieses Leaderboard rankt.

Das Audit: 394 Adjacent-Rank-Claims, 391 ohne Unterstützung

Mit dem Modell in der Hand auditieren die Autoren die Item-Korrektheitsmatrix des Open LLM Leaderboards: 395 Modelle, 28.659 Items, sechs Benchmarks (Polo et al., 2024)8. Sie nehmen alle 394 adjazenten Cross-Provider-Paare — die „Modell A schlägt Modell B um X“-Claims, für die ein Board existiert — und testen jeden als standardisierte Marge z mit gepaartem Standardfehler unter unabhängigem Item-Resampling, bei alpha = 0,05. Die Paare überlappen und sind nicht unabhängig; die Counts sind deskriptiv. Noch ist keine Selektionskorrektur eingeflossen. Die naive Spalte zertifiziert 3 von 394. Die Gauß-Spalte — die k=27 versteckte Varianten zu den auditierten Korrelationsschranken einpreist — zertifiziert null. Das ist die „391 ohne statistische Unterstützung“-Schlagzeile, und es ist ganz gewöhnliche Sampling-Unsicherheit, bevor Hidden Selection überhaupt verrechnet wird9.

Liest man die Mediane, hört die Zahl auf zu schockieren: Die mediane adjazente Marge ist z = 0,17, das 95. Perzentil z = 0,78. Die meisten adjazenten Leaderboard-Ranks wurden von ihren eigenen Items nie von null getrennt. Von den drei Claims, die den naiven Test bestehen, fallen zwei auf „not margin-certified“, sobald Selektion zu den auditierten Korrelationsschranken verrechnet wird, und einer wird model-insufficient — die angenommene Korrelationsschranke fällt für einen Near-Clone-Comparator aus dem Domänenbereich der Marge; das ist eine Aussage über die Anwendbarkeit des Modells, nicht über das Lab10. Bonferroni, das gar keine Korrelationsannahme braucht, stützt den letzten weiterhin.

Was überlebt — und was ein Leser daraus folgern sollte

Der Anti-Hype-Punkt wirkt in beide Richtungen, und die zweite Hälfte zu verlieren ist die Art, wie dieses Paper fehlzitiert wird. Es ist nicht „Leaderboards sind nutzlos.“ Was überlebt, ist präzise:

  1. Aggregierte Bewegung ist real. Die Autoren halten die Aggregatsentscheidungen des Audits für stabil — ein Board kann weiterhin sagen, zu welchem Tier ein Modell gehört.
  2. Große Margen sind in Ordnung. Ein Abstand von mehreren Punkten auf einem Composite mit Tausenden Items übersteht z = 2,7 mit Luft; „unser Modell führt um drei Punkte“-Claims sind nicht die gefährdeten. Was stirbt, ist der Adjacent-Rank-Vergleich — der Zwei-Plätze-Swap, über den dein Team slacked.
  3. Zwischen zwei Labs: Frag nach dem Paar, nicht nach den Ranks. Das Zertifikats-Regime braucht Item-Daten beider Modelle, einen gepaarten Standardfehler und eine angenommene Korrelationsschranke. Liegen zwei Labs-Modelle einen Rank auseinander, lautet die ehrliche Zusammenfassung „auf Item-Ebene ununterscheidbar“ — bis ein größerer Abstand oder unabhängige Bestätigungsdaten auftauchen.
  4. Eine deklarierte Variantenzahl allein Fixt nichts. Die Autoren stellen explizit klar: Eine selbstberichtete Anzahl verifiziert nicht, dass das Kandidatenset vor Benchmark-Feedback fixiert war — prospektive Offenlegung braucht das Protokoll, nicht die Zahl11.

Für einen Board-Betreiber ist die Ask des Papers bescheiden: Eine Kandidatenzahl plus ein Protokoll, wie das Kandidatenset fixiert wurde, anfordern und eine Sensitivitätskurve mit endlichen Bereichen, benannten Annahmen und Anwendbarkeitsstatus publizieren. Für den Leser bleibt die kompakte Heuristik dieses Artikels: Bei alpha = 0,05 und rho_w um 0,5–0,6 braucht ein Adjacent-Rank-Claim ein effektives z um 2,5–2,8, um gut zwei Dutzend versteckte Varianten zu überstehen — während die mediane adjazente Marge auf einem dichten Board bei rund 0,2 liegt. Die Lücke zwischen diesen beiden Zahlen ist das Hidden-Selection-Problem — kein Grund, Leaderboards zu ignorieren, aber ein Grund, von Ein-Platz-Siegen mehr zu verlangen.

Was man mitnehmen sollte

  • Eine publizierte Leaderboard-Marge ist ein Maximum über k privat evaluierte Varianten; die Provider-Level-Nullhypothese fragt, ob irgendeine Variante den Comparator wirklich schlägt.
  • Bei rho_w = 0,56 falsch-zertifiziert der naive 5-Prozent-Test 15,8 Prozent bei k=5, 34,7 Prozent bei k=27, 50,7 Prozent bei k=100 — aber Korrelation lässt 27 Varianten wie nur ~14 unabhängige Versuche wirken (Paper-Raster: n_eff 5–19).
  • Das benötigte z bei k=27 steigt von 1,645 auf 2,16 / 2,54 / 2,68 / 2,78, je tiefer die Familien-Korrelationsschranke von 0,92 auf 0,42 fällt.
  • Das Triple 0,90/0,46/0,92 ist eine Familie unter drei Estimands: Item-Pooling vs score-gematchtes Item-Resampling vs Subject-Block-Resampling — nur das Score-gematchte passt zu dem, wonach das Board rankt.
  • 391 von 394 Adjacent-Rank-Claims des Open LLM Leaderboards entbehren vor Selektion der statistischen Unterstützung; von den 3, die den naiven Test überstehen, zieht Selektionsverrechnung 2 zurück und schiebt 1 aus der Modell-Domäne.

Footnotes

  1. Yang, C., Zhang, X. und Chen, J., „How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?“, arXiv:2609.28177v1 [stat.ML], 23. September 2026. https://arxiv.org/html/2609.28177v1 ↩

  2. Formal H0_prov: Das Maximum der mu_pv über alle Varianten v ist höchstens mu_q. Eine Verwerfung zertifiziert, dass irgendeine versteckte Variante wirklich besser ist als der Comparator — nicht zwingend die eingereichte. Die Autoren leiten zusätzlich eine unbedingte Garantie für das eingereichte Modell her (Appendix B). ↩

  3. Zwei-Block-Gaußstruktur: Varianten-Scores teilen einen Item-Schwierigkeitsfaktor Z0 (kündigt sich in jeder Marge weg), einen Familienfaktor F_p (Korrelation rho_w) und idiosynkratisches Rauschen; der Comparator teilt Z0 mit Korrelation rho_b. Selbst unabhängige Modell-Scores erzeugen Margen mit Korrelation 1/2, weil jede Marge denselben Comparator-Score abzieht. ↩

  4. Pr(M > m) = E_G[ 1 - Phi((m - G)/sqrt(1-rho_w))^k ], ein eindimensionales Integral — die klassische Ein-Faktor-Dunnett-Darstellung (1955), abgebildet auf die Hidden-Selection-Marge. ↩

  5. Bei k=27, alpha=0,05 und rho_b=0,5 reicht die effektive unabhängig-äquivalente Anzahl des Papers je nach Korrelationsszenario von 5 bis 19; Near-Clones (rho_w gegen 1) kollabieren gegen 1, die Unabhängigkeitsgrenze reproduziert die endliche Řidák-Anzahl. ↩

  6. Proposition 2 des Papers: Benchmark b trägt Var_b/(G hoch 2 n_b) zur Sampling-Varianz des Composites bei, Score-Korrelationsgewichte skalieren also mit 1/n_b; die gepoolte Item-Kovarianz gewichtet nach Item-Anteilen und addiert eine zwischen-Benchmark-Schwierigkeitsterm, den die Score-Korrelation nie sieht. ↩

  7. Appendix E: Subject-Block-Resampling von MMLUs 57 Subjects (B = 20.000) verschiebt den score-gematchten Median der Arbeitsfamilie von 0,459 auf 0,921. ↩

  8. Polo et al. (2024), die Item-Korrektheitsmatrix des Open LLM Leaderboards — 395 Modelle mal 28.659 Items über sechs Benchmarks; Geschwister-Familien handkuratiert (12 Familien mit k=3–8) plus eine 45-Familien-v2-Erhebung. ↩

  9. Die Urteile sind paar-konditional — das Audit korrigiert nur die unbeobachtete innerfamiliäre Selektion des Providers, nicht welches Paar ein publizierter Claim wurde — und bei k=27 fixiert: die eine dokumentierte Multiplizität (von Arena, nicht diesen Boards), als Annahme benannt, nicht als Schätzung. ↩

  10. Model-insufficient heißt: Die angenommene Korrelationsschranke fällt unter 2*rho_b - 1, wo die Gauß-Margen-Domäne für einen Near-Clone-Comparator scheitert; dort greift nur annahmen-armes Bonferroni. Es ist kein Beweis gegen den Vorsprung des Labs. ↩

  11. Abschnitt 6: Ein Board kann eine Kandidatenzahl und ein Protokoll anfordern, wie das Kandidatenset vor Benchmark-Feedback fixiert wurde, und dann eine Sensitivitätskurve mit endlichem Bereich publizieren; mit vollständig offengelegten Kandidaten kann eine gemeinsame max-t-Inferenz den Nuisance-Aufschlag senken. ↩