← Zurück zur Ausgabe vom 19. August 2026

Reportage

Die Maschine, die sich selbst baut — und warum sie damit gerade nicht vorankommt

Zwei KI-Agenten bekamen sechs Tage, 3.000 Dollar Rechenbudget und eine offene Forschungsfrage. Beide lieferten ab, beide wurden von den Fachleuten abgelehnt, die die Originalarbeiten geschrieben hatten. Was der Befund für alle bedeutet, die ihre Produktplanung an den erwarteten Modellfortschritt hängen.

Von Stefan Lange-Hegermann · · 8 Minuten

Ein Experiment, das ungewöhnlich fair angelegt war

Der Versuchsaufbau ist so einfach, dass man sich fragt, warum ihn niemand früher gemacht hat. Ein Forscherteam um Peter Kirgis und Sayash Kapoor nahm zwei noch unveröffentlichte Einreichungen für die NeurIPS-Konferenz 2026 — also aktuelle, echte, offene Forschungsfragen aus der KI-Forschung selbst. Dann setzte es die derzeit besten verfügbaren Agentensysteme darauf an: sechs Tage Zeit, rund 3.000 Dollar Guthaben für Modellaufrufe, dazu Rechenkapazität auf Grafikkarten. Bewertet wurden die Ergebnisse anschließend von den Menschen, die die Originalarbeiten geschrieben hatten.

Beide Agentenarbeiten wurden abgelehnt. Nicht knapp. Kapoor formuliert es so, dass die Systeme bei der eigentlichen Forschung „unambiguously bad“ gewesen seien und die entstandenen Arbeiten „nowhere close to the mark“ im Vergleich zum Niveau einer Spitzenkonferenz.

Das Bemerkenswerte ist, was die Agenten dagegen mühelos schafften: das gesamte Ingenieurshandwerk. Code schreiben, Experimente aufsetzen, Läufe starten, Ergebnisse auswerten — ohne menschliche Hilfe, über Tage hinweg. Woran es scheiterte, war nichts Handwerkliches. Es waren fünf Muster, die sich in beiden Fällen wiederholten: Die Agenten konnten nicht beurteilen, was publikationswürdige Qualität ist, und verwarfen eigene Ansätze aus den falschen Gründen. Sie gingen unkreativ mit Schwächen im Versuchsaufbau um. Sie kamen aus Sackgassen nicht heraus und gaben ihre ehrgeizigsten Ziele bereits am ersten Tag auf. Sie hatten kein Gefühl für ihre Ressourcen — beide Läufe endeten mit weniger als der Hälfte des verbrauchten Budgets. Und sie drifteten von ausdrücklichen Vorgaben ab.

Man sollte den Befund nicht überdehnen: Es sind zwei Arbeiten, es ist ein Preprint ohne Begutachtung, und die Autoren benennen selbst, dass sie für eine bestimmte skeptische Position bekannt sind und das ihre Arbeit beeinflussen könnte. Aber die Richtung ist deutlich, und sie wird von unerwarteter Seite bestätigt. Jack Clark, Mitgründer von Anthropic, beschreibt das Ergebnis als Beleg für eine fehlende „valuable, intuitive creativity“ und nennt es ein bearishes Signal für kurze Zeithorizonte — derselbe Jack Clark, der die Wahrscheinlichkeit rekursiver Selbstverbesserung bis Ende 2028 öffentlich mit 60 Prozent angibt.

Worüber genau gestritten wird

Rekursive Selbstverbesserung, im Fachjargon RSI, meint nicht, dass KI beim Programmieren hilft. Sie meint einen geschlossenen Kreislauf: Ein System verbessert seinen eigenen Nachfolger, dieser Nachfolger verbessert seinen Nachfolger schneller, und die Kurve krümmt sich nach oben. Der entscheidende Unterschied zu allem, was heute passiert, liegt nicht in der Fähigkeit, sondern im Regelkreis — es braucht niemanden mehr, der beurteilt, ob der letzte Schritt eine Verbesserung war.

Genau diese Beurteilung ist die Stelle, an der die Agenten im Experiment scheiterten. Sie konnten arbeiten, aber nicht entscheiden, wann das Ergebnis gut genug ist. In der Forschungsliteratur trägt das Problem einen Namen: Selbstbewertung ohne externe Rückmeldung erzeugt Umformulierung statt Fortschritt. Ein Modell, das sich selbst korrigiert, ohne dass irgendetwas außerhalb seiner selbst „falsch“ sagt, dreht sich im Kreis.

Was tatsächlich schon läuft — und das ist beachtlich

Die skeptische Lesart wird schief, wenn man den Rest ausblendet. Anthropic gibt an, dass im Mai 2026 mehr als 80 Prozent des Codes, der in die eigene Codebasis einfloss, von Claude geschrieben wurde; vor Einführung des eigenen Coding-Werkzeugs Anfang 2025 lag der Wert im niedrigen einstelligen Bereich. Im zweiten Quartal 2026 führte ein durchschnittlicher Entwickler nach derselben Angabe achtmal so viel Code zusammen wie 2024. Bei OpenAI wurde eine ähnliche Größenordnung genannt. Das sind Herstellerangaben ohne offengelegte Methodik — aber selbst mit großzügigem Abschlag beschreiben sie eine veränderte Arbeitsrealität.

Auch bei der Optimierung selbst gibt es harte Fälle. Googles AlphaEvolve läuft seit über einem Jahr produktiv und gewinnt nach Unternehmensangaben im Schnitt 0,7 Prozent der weltweiten Google-Rechenkapazität zurück, indem es eine bessere Zuteilungsheuristik gefunden hat; dazu kommen zweistellige Prozentgewinne bei einzelnen Rechenkernen. Bei Stanfords KernelBench, einem unabhängigen Test für automatisch erzeugte GPU-Rechenkerne, steigt die Trefferquote eines Modells mit iterativer Rückmeldung über zehn Runden von 12 auf 43 Prozent in der einfachsten Kategorie. Und im Jahr 2026 hat erstmals eine vollständig maschinell erzeugte Arbeit ein reguläres Begutachtungsverfahren bestanden — dokumentiert in Nature.

Der Punkt ist nur: In jedem dieser Fälle steckt ein von Menschen gebautes Gerüst. AlphaEvolve arbeitet gegen eine automatisch prüfbare Zielfunktion. KernelBench liefert nach jedem Versuch ein eindeutiges Urteil, weil ein Rechenkern entweder korrekt und schneller ist oder nicht. Die maschinell erzeugte Arbeit brauchte rund zwanzig Stunden menschliche Vorbereitung. Überall dort, wo sich Erfolg mechanisch messen lässt, sind die Systeme stark. Offene Forschung ist definitionsgemäß der Fall, in dem das nicht geht.

Die Engpässe, die niemand wegprogrammiert

Vier Bremsen sind belegbar. Erstens die Hardware: Der Flaschenhals ist 2026 nicht mehr das Kapital, sondern die Fertigung — Lieferzeiten für Beschleunigerkarten von neun bis zwölf Monaten sind Alltag, Speicherbausteine bleiben nach Prognosen mindestens bis 2027 knapp. Zweitens die Daten: Dass Modelle, die rekursiv auf ihren eigenen Ausgaben trainieren, an Vielfalt verlieren, ist begutachtet belegt; ob sich das durch geschickte Mischung vermeiden lässt, ist offen und aktiv umstritten. Drittens die schon genannte Verifikation. Viertens abnehmende Erträge beim Nachdenken: Längere Gedankenketten verbessern das Ergebnis nicht monoton — es gibt einen Punkt, ab dem mehr Rechenzeit zur Antwortzeit schlechtere Antworten liefert.

Eine fünfte Bremse wird oft genannt, und wir haben sie bewusst nicht mit einer Zahl unterlegt, weil wir keine belastbare gefunden haben: die Zeit, die reale Experimente schlicht dauern. Sie klingt plausibel. Belegt ist sie nicht.

Was die Labore selbst hineingeschrieben haben

Aufschlussreich ist, dass alle drei führenden Labore eine RSI-Schwelle in ihren Sicherheitsrahmenwerken definiert haben — jeweils anders, jeweils erstaunlich konkret. Anthropic hält ein Modell dann für hochgefährlich, wenn es „could compress two years of 2018–2024 AI progress into a single year“. OpenAI beschreibt die kritische Stufe als ein System, das eine Modellgeneration in einem Fünftel der Zeit hervorbringt, die derselbe Fortschritt 2024 gebraucht hätte, und das über mehrere Monate anhaltend. Google DeepMind definiert die höchste Stufe als Fähigkeit, „the work of any team of researchers at Google focused on improving AI capabilities“ vollständig zu übernehmen.

Diese Formulierungen sind kein Beiwerk. Sie sind der Grund, warum bei OpenAI derzeit ein Trainingslauf pausiert und ein Rahmenwerk umgeschrieben wird — und warum sich die Personalie, die dort gerade für Diskussionen sorgt, ausgerechnet auf diesen Bereich verlagert hat.

Was das für Planung heißt

Hier wird es praktisch. Die Organisation METR misst seit Jahren, wie lange eine Aufgabe sein darf, die ein Modell mit 50 Prozent Erfolgswahrscheinlichkeit allein zu Ende bringt. Diese Länge hat sich zwischen 2019 und 2025 etwa alle sieben Monate verdoppelt, zuletzt schneller — etwa alle vier Monate. Aktuelle Spitzenmodelle liegen bei rund zwölf Stunden.

Die Zahl, die in Präsentationen fast nie auftaucht, ist die daneben: Verlangt man statt 50 Prozent eine Erfolgsquote von 80 Prozent, schrumpft dieselbe Länge auf etwa siebzig Minuten. Zwischen „schafft es meistens“ und „schafft es verlässlich“ liegt ein Faktor von rund zehn. Wer eine Roadmap auf die erste Zahl baut, plant mit einem Wert, den er im Betrieb nicht akzeptieren würde.

Und genau hier trifft das Experiment vom Anfang die Planungspraxis. Die METR-Kurve misst autonome Ausdauer bei Aufgaben mit klarem Erfolgskriterium — und die steigt tatsächlich steil. Sie misst nicht Urteilsvermögen bei offenen Fragen, und genau das ist die Fähigkeit, die für einen sich selbst tragenden Verbesserungskreislauf gebraucht würde. Beide Kurven werden gern als eine gezeichnet.

Für Entscheider heißt das dreierlei. Erstens: Automatisieren Sie zuerst dort, wo Sie den Erfolg maschinell prüfen können — Tests, Migrationen, Umformatierungen, Regressionen. Das ist kein Kompromiss, das ist genau der Bereich, in dem die Technik heute nachweislich funktioniert. Zweitens: Behandeln Sie die Prüfinstanz als das eigentliche Produkt. Wer einen belastbaren automatischen Prüfer hat, kann Agenten arbeiten lassen; wer keinen hat, kauft sich Umformulierung statt Fortschritt ein. Drittens: Rechnen Sie beim Modellfortschritt mit einer stetigen, aber nicht mit einer explodierenden Kurve. Die Belege für kontinuierliche Beschleunigung sind gut. Die Belege für den Sprung fehlen — und stammen, wo sie behauptet werden, überwiegend von Unternehmen, die diesen Sprung verkaufen.

Quellen