Zwei Rekorde an einem Dienstag
Am 1. September meldete Anthropic für Claude Fable 5.1 auf dem Testsatz Terminal-Bench-Science 52,6 Prozent gegenüber 24,7 Prozent für den Vorgänger — eine Verdopplung. Am selben Tag teilte OpenAI mit, das kommende Modell Astra erreiche auf ExploitBench, einem Test zur Entwicklung funktionierender Angriffe, das volle Ergebnis.
Beide Zahlen sind vermutlich korrekt gemessen. Beide werden in den nächsten Wochen in Präsentationen auftauchen, in denen jemand eine Beschaffungsentscheidung begründet. Und beide beantworten die Frage nicht, die dabei eigentlich gestellt wird: Wird dieses Modell die Arbeit in meinem Unternehmen besser erledigen als das, was ich heute einsetze?
Der Grund dafür ist kein Betrug. Er ist methodisch — und die Forschung, die das gerade systematisch nachmisst, hat in den vergangenen Monaten ungewöhnlich klare Ergebnisse geliefert. Vier davon reichen aus, um Ranglisten künftig anders zu lesen.
Was eine Benchmark-Zahl überhaupt misst
Ebenfalls am 1. September veröffentlichte das Allen Institute for AI eine Untersuchung namens BenchMIRT. Der Ansatz stammt aus der Psychometrie, also aus der Wissenschaft vom Messen menschlicher Fähigkeiten. Ihre zentrale Idee heißt Item-Response-Theorie und lässt sich in einem Satz erklären: Ob jemand eine Frage richtig beantwortet, hängt von zwei Dingen ab — von seiner Fähigkeit und von den Eigenschaften der Frage. Eine Frage kann schwer sein. Sie kann aber auch schlecht trennen, also starke und schwache Kandidaten nicht auseinanderhalten. Beides sind Eigenschaften der Frage, nicht des Kandidaten.
Genau das hat Ai2 auf Sprachmodelle angewandt: 100 Modelle, 16 Testsätze, über 34.000 Einzelfragen — sechs Testsätze zum allgemeinen Denken, darunter MMLU-Pro, GPQA, MATH und BBH, dazu zehn aus der hauseigenen Sicherheitssammlung. Der Methode wurde ausdrücklich nicht gesagt, welcher Testsatz was misst; sie sollte die verborgenen Fähigkeitsdimensionen selbst finden. Herausgekommen sind zwei, und sie kamen bei jeder Wiederholung wieder heraus: Sicherheit und allgemeines Denkvermögen.
Interessant sind die Zuordnungen. BBQ, ein Testsatz für soziale Vorurteile, der üblicherweise zu den Sicherheitstests gezählt wird, lud deutlich stärker auf allgemeines Denken. Ein schlechtes Ergebnis dort kann also schlicht heißen, dass ein Modell die verschachtelten Fragen nicht sauber auflöst — nicht, dass es voreingenommen ist. Noch schöner ist der Fall WMDP, das gefährliches Doppelverwendungs-Wissen abfragt: Auch hier dominiert das Denkvermögen, aber mit umgekehrtem Vorzeichen. Weil der Test das Verweigern der Antwort als erwünschtes Verhalten wertet, geht stärkeres Denkvermögen mit niedrigeren Punktzahlen einher. Und bei HarmBench spalten sich die Fragen: Die schädlichen Anfragen verhalten sich wie ein Sicherheitstest, die Urheberrechtsfragen wie ein Denktest.
Übersetzt heißt das: Diese Tests messen zu erheblichen Teilen nicht das, was auf der Verpackung steht — sie messen, ob ein Modell allgemein klug ist. Wenn Sie also einen Anbieter nach dem Abschneiden bei einem Sicherheitstest fragen und eine hohe Zahl bekommen, haben Sie möglicherweise nur ein weiteres Maß für allgemeine Leistungsfähigkeit in der Hand — dieselbe Information, die Sie schon aus drei anderen Zahlen hatten.
Als praktische Nebenerkenntnis fand Ai2 außerdem: Behält man nur zehn Prozent der Fragen, bleibt die Rangfolge der Modelle im Wesentlichen erhalten. Neunzig Prozent des Testaufwands liefern keinen zusätzlichen Unterschied.
Problem eins: Der Nenner ist erstaunlich klein
Der zweite Befund ist unspektakulär und wird deshalb am häufigsten übersehen. Terminal-Bench 2.0, der Testsatz, aus dessen Nachfolgeversion die oben zitierten Prozentwerte für agentisches Programmieren stammen, besteht aus 89 Aufgaben. Ausgewählt wurden sie aus 229 Einreichungen von 93 Beitragenden.
89 Aufgaben sind eine sorgfältig kuratierte Sammlung. Sie sind aber auch eine sehr kleine Stichprobe. Ein Unterschied von drei Prozentpunkten zwischen zwei Modellen entspricht hier weniger als drei gelösten Aufgaben. Wenn Sie in einer Anbieterpräsentation eine Rangliste sehen, in der die ersten vier Modelle innerhalb von fünf Prozentpunkten liegen, sehen Sie mit einiger Wahrscheinlichkeit Rauschen, das als Reihenfolge dargestellt wird. Verlangen Sie Konfidenzintervalle. Die meisten Ranglisten geben keine an.
Problem zwei: Bestanden ist nicht dasselbe wie richtig
Der dritte Befund ist der unangenehmste. Eine Gruppe um Boxi Yu hat unter dem Namen SWE-ABS die Lösungen der besten dreißig Systeme auf SWE-Bench Verified erneut geprüft — dem bekanntesten Testsatz für automatische Fehlerbehebung in echtem Quellcode. Das Verfahren dort ist einfach: Der Agent ändert Code, dann laufen die vorhandenen Tests. Laufen sie durch, gilt die Aufgabe als gelöst.
Das Ergebnis der Nachprüfung: Eine von fünf als gelöst gezählten Änderungen ist inhaltlich falsch. Sie besteht die Prüfung nur deshalb, weil die Testfälle die Fehler nicht aufdecken. Beim führenden System fällt die Erfolgsquote nach der Korrektur von 78,80 auf 62,20 Prozent — und es rutscht von Platz eins auf Platz fünf.
Für jeden, der in seinem eigenen Unternehmen schon einmal eine Testabdeckung beurteilt hat, ist das keine Überraschung, sondern eine Erinnerung: Ein Test prüft, was er prüft. Ein Modell, das darauf optimiert wurde, Tests grün zu bekommen, wird Tests grün bekommen. Ob der Code richtig ist, ist eine andere Frage — und in der Produktion Ihre.
Problem drei: Sie kaufen kein Modell, Sie kaufen ein System
Der vierte Befund verschiebt die Perspektive. Eine Arbeitsgruppe um Maria Gorinova argumentiert, dass Programmier-Testsätze grundsätzlich das Falsche zusammenfassen: Sie pressen Modell, Gerüst und Umgebung in eine einzige Gesamtnote. Ein Coding-Agent in der Praxis ist eben kein Modell, sondern ein Verbund aus Modell, Werkzeug-Gerüst, Kontextaufbereitung, Ausführungsumgebung und Rückmeldeschleifen. Und jede einzelne dieser Komponenten kann die Punktzahl um Beträge verschieben, die dem Fortschritt zwischen zwei Modellgenerationen entsprechen.
Das ist die praktisch folgenreichste Einsicht dieses Textes. Wenn ein Anbieter Ihnen eine Verbesserung von acht Prozentpunkten zeigt, wissen Sie zunächst nicht, ob sie aus dem Modell kommt oder aus dem Gerüst, in dem er es getestet hat. In Ihrem Haus läuft ein anderes Gerüst. Eine ergänzende Übersichtsarbeit von Wael Albayaydh und Kollegen, die 27 Untersuchungen zu 19 Testsätzen zusammenführt, formuliert die zugehörige Warnung: Gute Leistung auf Teilaufgaben übersetzt sich nicht verlässlich in Erfolg über die gesamte Aufgabe, und Fehler häufen sich mit zunehmender Aufgabenlänge nicht linear, sondern überproportional.
Wir haben dafür ein Beispiel aus dem eigenen Archiv. In unserer Ausgabe vom 19. August haben wir eine unabhängige Nachmessung eines beworbenen Modellvorsprungs referiert. Übrig blieb ein Vorsprung von 0,7 Prozentpunkten in genau einer Disziplin.
Was daraus für die Beschaffung folgt
Nichts davon heißt, dass Benchmarks wertlos sind. Sie sind ein brauchbares Vorfilter: Ein Modell, das auf mehreren unabhängigen Testsätzen deutlich zurückliegt, wird Ihre Aufgabe vermutlich auch nicht besser lösen. Ranglisten taugen zum Aussortieren. Zum Auswählen taugen sie nicht.
Fünf Fragen ändern die Qualität eines Anbietergesprächs sofort:
Erstens: Wie viele Aufgaben enthält der Testsatz, und wie groß ist das Konfidenzintervall? Bei zweistelligen Aufgabenzahlen sind Ranglistenplätze innerhalb weniger Prozentpunkte bedeutungslos.
Zweitens: Wer hat gemessen, und in welchem Gerüst? Selbstgemessene Zahlen im hauseigenen Gerüst sind kein Betrug, aber auch keine Aussage über Ihr Gerüst. Fragen Sie nach unabhängigen Nachmessungen.
Drittens: Was genau zählt als bestanden? Bei testbasierten Verfahren ist die Antwort „die vorhandenen Tests laufen durch“ — mit den bekannten Folgen.
Viertens: Misst dieser Testsatz das, wonach er heißt? Nach dem Ai2-Befund messen mehrere verbreitete Sicherheitstests zu großen Teilen allgemeines Denkvermögen.
Fünftens — und das ist die wichtigste: Was ist Ihr eigener Testsatz? Fünfzig bis zweihundert echte Fälle aus Ihrem Betrieb, mit einer Bewertung, auf die sich Ihr Fachbereich geeinigt hat, schlagen jede öffentliche Rangliste. Sie sind auch der einzige Testsatz, den kein Modell im Training gesehen hat. Der Aufwand dafür liegt bei wenigen Personentagen — deutlich unter dem, was ein falsch gewähltes Modell über ein Jahr kostet.
Der Preis ist auch eine Benchmark
Zum Schluss ein Beispiel, das dieselbe Lesetechnik auf eine Zahl anwendet, die nicht aus einem Testsatz stammt. Anthropic bewirbt Claude Fable 5.1 mit bis zu 45 Prozent niedrigeren Kosten. Wer nachliest, findet die Mechanik: Ein- und Ausgabepreise sind unverändert, gesenkt wurde ausschließlich der Preis für Cache-Treffer, von einem Dollar auf 25 Cent je Million Token. Anthropic nennt deshalb korrekterweise zwei Zahlen — rund 25 Prozent bei typischen Lasten, bis zu 45 Prozent bei stark agentischen Abläufen.
Die 45 Prozent sind kein Rabatt auf das Produkt. Sie sind ein Rabatt auf ein bestimmtes Nutzungsmuster: viele Werkzeugaufrufe, die denselben Kontext immer wieder mitschleppen. Wer das Modell für kurze Einzelanfragen einsetzt, wird davon fast nichts merken.
Damit ist die Regel für beide Arten von Zahlen dieselbe. Eine Benchmark-Zahl und eine Ersparnis-Zahl beschreiben beide ein Ergebnis unter Bedingungen. Die einzige Frage, die zählt, lautet: Sind das Ihre Bedingungen?
- Ai2 — BenchMIRT: What are LLM benchmarks actually measuring?
- GitHub — allenai/BenchMIRT
- arXiv — SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark
- arXiv — Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering
- arXiv — Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in LLM Agents
- Hugging Face — Datensatz terminal-bench-2.0 (89 Aufgaben)
- Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1
- Claude Platform Docs — Claude Fable 5.1 Überblick