Benchmarks · Agenten
Von 30 auf 100 Prozent, ohne das Modell anzufassen: Warum Nvidias Bestwert vor allem zeigt, wie wenig eine Benchmark-Zahl ohne ihre Fußnoten wert ist
Am 21. August hat Nvidia im hauseigenen Technical Blog gemeldet, das Agentensystem AVO — ausgeschrieben Agentic Variation Operators — habe auf dem Benchmark ARC-AGI-3 einen RHAE-Wert von 100,00 erreicht und dabei alle 183 Level in 25 Umgebungen gelöst. Zum Vergleich stellt Nvidia rund 30 Prozent für Claude Opus 5. Der Clou: AVO ist Claude Opus 5. Verändert wurde nicht das Modell, sondern alles darum herum.
Was ARC-AGI-3 misst, und warum es als schwer gilt. Der Benchmark stammt von der ARC Prize Foundation um François Chollet und ist der erste interaktive der Reihe. Statt statische Puzzles vorzulegen, setzt er einen Agenten in spielartige 2D-Umgebungen — ohne Anleitung, ohne erklärte Regeln, ohne genanntes Ziel. Der Agent muss die Mechanik durch Ausprobieren selbst erschließen, sich ein Modell der Welt bauen und über lange Handlungsketten mit spärlicher Rückmeldung planen. Für nichttechnische Leser ist das der entscheidende Unterschied zu einem Wissenstest: Hier wird geprüft, ob ein System sich in einer völlig neuen, unbeschrifteten Lage allein zurechtfindet. Genau das ist die Fähigkeit, die man von einem Agenten im Betrieb erwartet — und genau die, die reines Mustererkennen aus Trainingsdaten nicht liefert.
Was AVO tatsächlich tut. Die Architektur ist unspektakulär und gerade deshalb interessant: eine Schleife aus Inspizieren, Planen, Implementieren und Auswerten; ein Gedächtnis, das frühere Versuche, deren Ergebnisse und die Ausgaben des Übersetzers über die Runden hinweg mitführt; Werkzeuge, mit denen der Agent Code ausführen und Ergebnisse selbst nachprüfen kann. Der Baustein, den Nvidia selbst hervorhebt, ist ein zweiter Agent: ein Supervisor, der erkennt, wenn der Hauptagent sich im Kreis dreht, und ihn umlenkt. Adel El Hallak, VP Product in Nvidias KI-Sparte, gegenüber TechCrunch: „The more interesting part was introducing a supervising agent in addition to your main agent that's doing the work.“ Und grundsätzlicher: „Generally speaking, the world interprets an agent almost as an API of the model. But an agent is actually more than that. It is the model. It is the scaffolding around the model, which we call the harness, i.e. the set of tools that it utilizes.“
Und jetzt die Fußnoten — die erste liefert Nvidia selbst. Im Blogpost steht wörtlich: „These results cover the 25-environment ARC-AGI-3 public set using the official scorecard and RHAE metric. They are not results on the semi-private or fully private competition sets.“ Das ist eine bemerkenswert ehrliche Einschränkung, und sie ist zentral. ARC Prize führt seine offizielle Rangliste auf dem Semi-Private-Satz, gerade weil öffentlich zugängliche Aufgaben mit der Zeit in Trainingsdaten und Lösungswege einsickern. Nvidias Ergebnis ist also nicht auf dem Satz erzielt, der zählt.
Die zweite Fußnote betrifft den Vergleichswert. Die rund 30 Prozent, gegen die Nvidia seine 100 stellt, stammen nicht aus Nvidias eigenem Testlauf, sondern von ARC Prize — dort steht Claude Opus 5 mit hohem Reasoning-Aufwand bei 30,16 Prozent, geprüft am Semi-Private-Satz, zu Kosten von 20.657 Dollar für den Durchlauf. Verglichen werden damit zwei Zahlen aus zwei verschiedenen Datensätzen unterschiedlicher Härte. Der eigentlich naheliegende Vergleich — dasselbe Modell mit und ohne Harness auf demselben Satz — fehlt in der Quelle. Wie groß der Sprung wirklich ist, lässt sich aus den veröffentlichten Angaben deshalb nicht sauber ablesen.
Die dritte Fußnote ist die unbequemste: AVO war nicht die Erste. Das akademische Projekt VISTA hat auf denselben 25 öffentlichen Umgebungen mit demselben Basismodell bereits vorher einen RHAE-Wert von 100 erreicht — Nvidia führt VISTA im eigenen Blogpost als Vergleichsgrundlage an und schreibt, man habe „adopted the direct-interaction design principles described by VISTA and reimplemented the task interface independently“. Ein weiteres Projekt, Schema-Harness, berichtet nach eigenen Angaben rund 99 Prozent. Der Effizienzvorsprung, den Nvidia für sich reklamiert, beträgt gegenüber VISTA etwa 12 Prozent weniger Aktionen (6.624 gegen 7.542) — Nvidia räumt allerdings selbst ein, dass sich beide Systeme in Modell-Backend, Beobachtungsdarstellung, Gedächtnis und Kontextführung unterscheiden und der Vergleich deshalb nicht sauber ist. Kosten- oder Laufzeitangaben pro Aufgabe nennt der Blogpost nicht.
Fairerweise muss man sagen: Nvidia schreibt die wichtigste Einschränkung selbst hin. Im Blogpost heißt es, der Vergleich zum nackten Modell „should not be interpreted as a controlled ablation“ — also ausdrücklich nicht als saubere Isolierung der einen veränderten Variable. Und weiter, in einem Satz, der die ganze Meldung besser zusammenfasst als ihre Überschrift: „benchmark performance reflects the complete agent system, not only the underlying model.“ Das ist keine Marketingaussage, sondern eine methodisch korrekte. Die 100 Prozent gehören nicht Claude Opus 5 und auch nicht Nvidia, sondern der Kombination aus beidem — und genau das ist die eigentliche Nachricht.
Was das für die Einordnung heißt. AVO taucht in der offiziellen ARC-Prize-Rangliste nicht auf. Das ist kein Vorwurf, sondern eine Folge der Regeln: Nach der veröffentlichten Verifizierungsrichtlinie führt ARC Prize die als verified gekennzeichneten Werte selbst durch, über standardisierte öffentliche Modellschnittstellen; eingereichte eigene Harness-Läufe werden standardmäßig nicht verifiziert. Für eine Verifizierung wären ein Code-Audit, eine in unter zwölf Stunden reproduzierbare Ausführung als Kaggle-Notebook, die vollständige Offenlegung der Lösung als Open Source und eine Kostenobergrenze von 10.000 Dollar pro Lauf nötig. Nichts davon ist für AVO öffentlich nachvollziehbar. Eine Stellungnahme der ARC Prize Foundation zu Nvidias Meldung war bis Redaktionsschluss nicht auffindbar.
Warum die These trotzdem trägt. Es wäre falsch, die Meldung wegen ihrer Fußnoten abzutun — der Kern stimmt, und er wird von unabhängigen Datenpunkten gestützt. TechCrunch berichtet, auch OpenAI habe seine ARC-AGI-3-Werte verdreifacht, indem lediglich zwei Einstellungen am Harness verändert wurden. Databricks-Chef Ali Ghodsi beschreibt dieselbe Hebelwirkung auf der Kostenseite: „You can pick the same model but different harnesses, and you get significantly more cost if you use the wrong harness … That itself can 2x your cost.“ Und der vielleicht stärkste Beleg ist gerade die dritte Fußnote: Dass voneinander unabhängige Gruppen — ein akademisches Projekt und ein Konzernlabor — mit demselben Basismodell von etwa 30 auf nahezu 100 Prozent kommen, zeigt robuster als jede Einzelmeldung, wie groß der Hebel von Gedächtnisführung, Rückkopplungsschleifen und Werkzeugorchestrierung ist.
Was Sie praktisch daraus mitnehmen sollten. Erstens: Wenn ein Anbieter eine Benchmark-Zahl nennt, ist die erste Frage nicht „wie hoch“, sondern „auf welchem Satz, von wem geprüft, mit welchem Gerüst darum herum“. Zweitens: Der größte verfügbare Hebel für die Qualität eines Agenten liegt derzeit nicht im nächsten Modellwechsel, sondern in der Schicht darum herum — und diese Schicht können Sie selbst kontrollieren. Drittens, und das ist die Kehrseite: Dieselbe Schicht bestimmt Ihre Rechnung. El Hallak wirbt erkennbar für offene Systeme — „We believe, and we're demonstrating with the ecosystem, how open harnesses allow you to turn a lot more knobs to drive up that accuracy.“ — und man darf mitdenken, dass Nvidia ein Interesse daran hat, dass möglichst viele Knöpfe möglichst viel Rechenzeit verbrauchen. Warum die Harness-Schicht 2026 zur eigentlichen Produktentscheidung geworden ist, führen wir in der Reportage dieser Ausgabe aus.
- NVIDIA Technical Blog — NVIDIA AVO Reaches 100% on ARC-AGI-3 (Primärquelle/Herstellerangabe, 21.8.2026)
- TechCrunch — Nvidia just showed that the harness, not the AI model, is now the real hero (Julie Bort, 21.8.2026)
- ARC Prize — Offizielles Leaderboard (Primärquelle)
- ARC Prize — Verifiziertes Ergebnis für Claude Opus 5 (30,16 %)
- ARC Prize — Verifizierungsrichtlinie
- ARC Prize — ARC-AGI-3 Benchmark-Beschreibung
- VISTA — Vergleichs-Harness mit 100 % RHAE auf demselben Public Set
- Schema-Harness — Projektseite (Eigenangabe rund 99 %)
- The New Stack — Claude Opus 5 scored 30% on ARC-AGI-3. Wrapped in Nvidia's AVO, it hit 100% (Adrian Bridgwater, 21.8.2026)