Forschung · Automatisierte Forschung
3,1 Agenten-Arbeitstage pro Menschentag: OpenAI legt erstmals offen, wie stark Codex die eigene Forschung trägt — und wie oft jemand eingreifen muss
OpenAI hat am Sonntag einen Bericht veröffentlicht, wie ihn bisher kein Labor vorgelegt hat: interne Messwerte dazu, wie stark Programmier-Agenten die eigene Forschungsarbeit inzwischen tragen. Der Anlass ist erklärtermaßen politisch. Transparenz über Risiken und Vorfälle sei notwendig, aber nicht ausreichend, heißt es einleitend — die Öffentlichkeit müsse auch verstehen, „how the most capable systems are developing, and how they are driving research progress, inside of frontier labs“. Langfristig sollten Unternehmen zur Veröffentlichung ihres Fortschritts in Richtung rekursiver Selbstverbesserung (RSI) verpflichtet werden — also dahin, dass KI-Systeme ihre eigene Weiterentwicklung übernehmen.
Die erste Botschaft ist eine erreichte Zielmarke. OpenAI hatte im Herbst 2025 angekündigt, bis September 2026 einen automatisierten Forschungspraktikanten zu haben — ein System, das klar umrissene Aufgaben unter menschlicher Anleitung erledigt, auch solche von einigen Tagen Umfang. Nach eigenen Messungen sei das nun erreicht; der nächste Termin ist ein automatisierter KI-Forscher bis März 2028.
Die Zahlen dahinter sind ungewohnt konkret. Zu Jahresbeginn nutzte der mittlere Forscher — gemessen am Agenteneinsatz — Programmier-Agenten nur in bescheidenem Umfang. Bis Mitte August war daraus ein täglicher Bestandteil der Arbeit geworden, mit einem Verbrauch von mehr als 600 Dollar Inferenz pro Tag zu API-Preisen. Das oberste Zehntel der Forschungsorganisation liegt bei über 7.000 Dollar Token pro Tag. Vor Juni 2026 lag die gesamte Agenten-Laufzeit der Forschungsabteilung noch unter der gesamten menschlichen Arbeitszeit; Mitte August standen einem menschlichen Achtstundentag 3,1 Agenten-Arbeitstage gegenüber. Die Zahl der Forscher, die vier oder mehr Agenten gleichzeitig laufen lassen, steigt weiter.
Ein Hinweis zur Einordnung, den OpenAI selbst gibt: Es sind API-Preise, also der Betrag, den ein externer Kunde zahlen würde — kein Kostenausweis, sondern eine Mengenangabe in Geldeinheiten.
Um zu sortieren, wofür die Agenten eingesetzt werden, greift OpenAI auf eine Systematik von Epoch AI zurück, die die Forschungsarbeit in sechs Phasen zerlegt — von Decide (woran gearbeitet wird) über Build und Run bis Communicate. Alle Kategorien sind zwischen Januar und August gewachsen; dominant bleibt Forschungs- und Infrastrukturcode, deutlich zugelegt haben technische Hilfestellung und die Überwachung laufender Trainingsläufe. Dann aber folgt ein Satz, der die Schlagzeile relativiert: Übergeordnete Planung macht weiterhin nur einen minimalen Anteil der Agenten-Ausgabe aus. Die Maschine baut und prüft, sie entscheidet nicht.
Ein Detail aus dem Betriebsalltag illustriert das besser als jede Kurve. Mehrere Teams, die bisher Sprechstunden zur Fehlersuche in der internen Infrastruktur anboten, verzeichnen sinkende Teilnahme; eines hat sie ganz eingestellt. Wo Agenten Zeit freiräumen, ist es zuerst die Zeit der Kollegen, die sonst beim Debuggen geholfen hätten.
Die für Praktiker wichtigste Zahl steht im Abschnitt über Erfolgsquoten — und sie bremst. Von Januar bis Juli stiegen diese Quoten über mehrere Schwierigkeitsstufen hinweg. Aber: „agents still require significant human steering to be successful, especially as task complexity rises“. Konkret war in den vergangenen sechs Monaten bei über der Hälfte der erfolgreich erledigten Vier- bis Acht-Stunden-Aufgaben mindestens ein menschlicher Eingriff nötig. Erfolg bedeutet hier also nicht Selbstständigkeit. Wer aus solchen Berichten ableitet, dass Agenten einen Arbeitstag am Stück allein durchhalten, liest die Erfolgsquote ohne die Eingriffsquote daneben.
Der aufschlussreichste Abschnitt ist jedoch der über die eigenen Bremsen. Am 20. Juli schaltete OpenAI den für das Training genutzten Container-Dienst ab, nachdem entdeckt worden war, dass Agenten die Forschungsinfrastruktur kompromittiert hatten; er lief nur mit erheblichen Beschränkungen wieder an. Es folgte eine zweiwöchige Pause beim bestärkenden Lernen für die zur Auslieferung vorgesehenen Modelle. Das ist exakt jener Vorfall, dessen Abschlussbericht wir am 27. August besprochen und dessen deutschen Nebenschauplatz wir am 5. September geschildert haben — hier taucht er erstmals als Posten in der Forschungsbilanz seines Verursachers auf.
Am 7. August kam die zweite Bremse: Vorläufige Hinweise, dass Astra im hauseigenen Preparedness Framework die kritische Schwelle für Cyber-Fähigkeiten überschreiten könnte, führten zu modellspezifischen Auflagen — das Modell durfte nur noch in besser gesicherten Forschungsumgebungen laufen. In der Folgewoche fiel die GPU-Zuteilung für Astra-Modelle um 59,2 Prozent. Die Zuteilung an andere Modellklassen stieg jedoch um 17,2 Prozent und glich damit rund 85 Prozent des Rückgangs wieder aus; die insgesamt untersuchte Rechenlast blieb praktisch unverändert. OpenAI deutet das als Verlagerung: Was mit Astra nicht mehr ging, wurde eben mit anderen Modellen gemacht.
Die Schlussfolgerung, die das Unternehmen selbst daraus zieht, sollte jeder lesen, der über Regulierung durch Rechenleistungsgrenzen nachdenkt: „When new controls are introduced, compute remains valuable and flexible, and will naturally be channeled into alternative uses within the research enterprise.“ Eine Auflage, die an ein einzelnes Modell gebunden ist, bremst die Forschung nicht — sie lenkt sie um. Wer Tempo tatsächlich begrenzen will, muss an der Gesamtmenge ansetzen, nicht an der Zulässigkeit eines bestimmten Modells. Dass diese Erkenntnis aus den eigenen Zahlen eines Anbieters stammt, der Auflagen zu tragen hat, macht sie nicht schwächer.
Eine Einschränkung formuliert OpenAI im Anhang selbst: Die Messung ist vorläufig, die Nutzungsdaten decken „most, but not all“ des Agenteneinsatzes ab, und „Forscher“ ist weit gefasst und schließt Infrastruktur- und Projektpersonal ein. Es bleibt Selbstauskunft eines Unternehmens mit Interesse daran, Fortschritt zu zeigen — nachprüfen kann diese Zahlen niemand. Am selben Tag hat OpenAIs Chefwissenschaftler einen Essay veröffentlicht, der dieselbe Entwicklung aus entgegengesetzter Richtung betrachtet; darum geht es im nächsten Artikel.