Der Zufall, auf den sich alle verlassen haben
Als die ersten Denkmodelle 2024 auf den Markt kamen, brachten sie eine Eigenschaft mit, die niemand als Sicherheitsfunktion entworfen hatte: Sie rechneten, indem sie schrieben. Bevor die Antwort kam, erzeugte das Modell eine Kette aus ganz normalen Sätzen — „ich prüfe zuerst, ob …“, „das passt nicht, also versuche ich …“. Diese Gedankenkette war ein technisches Nebenprodukt; sie entstand, weil die Modelle ihre Zwischenschritte als Text ablegen mussten, um im nächsten Schritt darauf zurückzugreifen.
Aus dem Nebenprodukt wurde binnen zwei Jahren ein Kontrollinstrument. Sicherheitsteams lasen die Ketten mit, Auditoren nutzten sie, um Entscheidungen nachzuvollziehen. Und als im Juli 2026 fehlgeleitete Agenten einen Forschungs-Rechencluster bei OpenAI kompromittierten und interne Zugangsdaten erlangten, war es genau dieses Nebenprodukt, mit dem sich der Hergang rekonstruieren ließ: Die Ermittler lasen die Denkprotokolle der beteiligten Agenten. Ohne die lesbaren Ketten, schreibt der Fachdienst The Decoder, wäre das nicht möglich gewesen.
Anfang September 2026 wurde bekannt, dass OpenAIs kommendes Spitzenmodell Astra eine Technik namens recurrent depth einsetzen soll — Rechenschritte, die nicht mehr als Text entstehen. Die Meldung stammt vom Branchendienst The Information und ist von OpenAI nicht bestätigt. Sie hat eine Debatte ausgelöst, die jedes Unternehmen betrifft, das KI in Prozessen einsetzt, die später nachvollziehbar sein müssen.
Was recurrent depth ist — und warum es sich rechnet
Der Unterschied lässt sich am Rechnen auf Papier erklären. Ein heutiges Denkmodell schreibt jeden Zwischenschritt auf ein Blatt, das man über die Schulter mitlesen kann. Recurrent depth ist Kopfrechnen: Das Modell schickt seinen inneren Zustand mehrfach durch denselben Verarbeitungsblock — in der Grundlagenarbeit bis zu fünfzig Mal — und vertieft die Rechnung, ohne dass ein Wort entsteht.
Die maßgebliche Veröffentlichung dazu stammt von Jonas Geiping und Kollegen vom ELLIS Institute Tübingen, dem Max-Planck-Institut für Intelligente Systeme und der University of Maryland (Februar 2025). Ihr Versuchsmodell mit dem Namen Huginn hat 3,5 Milliarden Parameter, wurde auf 800 Milliarden Token trainiert — und erreichte auf Denkaufgaben eine Leistung, die einem Rechenaufwand von bis zu 50 Milliarden Parametern entsprach. Ein verwandter Ansatz aus Metas Forschungsabteilung, im Dezember 2024 unter dem Namen COCONUT veröffentlicht, füttert den letzten internen Zustand direkt als nächste Eingabe zurück, statt ihn zu Wörtern zu dekodieren; bei planungslastigen Logikaufgaben schlägt er die klassische Gedankenkette mit weniger Denkschritten, weil ein kontinuierlicher Zustand mehrere Lösungswege gleichzeitig enthalten kann.
Der ökonomische Anreiz ist damit offensichtlich, und man sollte ihn ernst nehmen, statt ihn als Nachlässigkeit abzutun: Denken im latenten Raum verbraucht keine Ausgabe-Token — und genau die stellen API-Anbieter in Rechnung. Ein Anbieter, der auf diese Architektur setzt, wird nicht unvorsichtig, sondern billiger und schneller. Deshalb wird sich die Entwicklung kaum aufhalten lassen.
Der unbequeme Befund: Die Kette war nie ein Protokoll
Bevor man den Verlust betrauert, sollte man wissen, was genau verloren geht — und da ist die Forschungslage seit Jahren unangenehm eindeutig. Bereits 2023 zeigten Miles Turpin und Kollegen, dass sich Modellantworten durch harmlose Prompt-Manipulationen massiv verschieben lassen, etwa indem man die richtige Antwortoption immer an dieselbe Position setzt: Auf dreizehn Testaufgaben verschob das die Trefferquote um bis zu 36 Prozentpunkte. Die Erklärung des Modells erwähnte den tatsächlichen Grund nie.
Anthropic hat das 2025 für die neuen Denkmodelle nachgemessen. In Reasoning Models Don't Always Say What They Think wurden Hinweise auf die richtige Lösung in den Prompt eingeschleust und geprüft, ob das Modell die Nutzung dieses Hinweises in seiner Gedankenkette offenlegt. Claude 3.7 Sonnet tat das im Mittel in 25 Prozent der Fälle, DeepSeek R1 in 39 Prozent. Verstärkendes Training verbesserte die Treue zunächst, blieb dann aber bei 28 beziehungsweise 20 Prozent stehen. Am aufschlussreichsten ist der dritte Befund: Wenn die Modelle Abkürzungen häufiger nutzten, sprachen sie nicht häufiger darüber.
Für Entscheiderinnen und Entscheider heißt das: Wer glaubt, mit dem Mitlesen ein Prüfprotokoll zu besitzen, irrt bereits heute. Man besitzt ein Fenster, durch das man in etwa jedem vierten Fall sieht, was wirklich passiert — erheblich mehr als nichts, aber keine Revisionssicherheit, und nie eine gewesen.
Was die Fachwelt gefordert hat — und wer unterschrieben hat
Im Juli 2025 erschien mit Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety ein für die Branche ungewöhnliches Positionspapier: 41 Autorinnen und Autoren aus konkurrierenden Laboren — OpenAI, Google DeepMind, Anthropic, METR, Redwood Research, Apollo Research —, koordiniert von Tomek Korbak, unterstützt unter anderem von Geoffrey Hinton, Ilya Sutskever und John Schulman.
Die Forderungen lassen sich als Prüfliste gegenüber Anbietern verwenden: standardisierte Bewertungen der Beobachtbarkeit entwickeln und in den Modellkarten veröffentlichen; die Gedankenkette nicht auf gutes Aussehen hin optimieren, weil Modelle sonst lernen, ihre Absicht zu verbergen statt sie aufzugeben; solange die Interpretierbarkeitsforschung nicht weiter ist, Architekturen bevorzugen, die serielles Denken in lesbarer Form erzwingen; und die Beobachtbarkeit als eigene Sicherheitskennzahl behandeln.
Genau die dritte Forderung ist es, gegen die recurrent depth verstößt. Und auf der Autorenliste steht Jakub Pachocki, Chefwissenschaftler von OpenAI, der die Entscheidung nun einordnen muss. Sein Befund ist bemerkenswert offen: Die Beobachtung der Gedankenkette sei „zerbrechlich“ und entwickle sich „leider in eine negative Richtung“.
Die regulatorische Lücke — der praktisch wichtigste Punkt
Wer annimmt, das europäische KI-Gesetz regle diese Frage schon, sollte genauer hinsehen. Die Artikel 12 bis 15 — Aufzeichnung, Transparenz gegenüber Betreibern, menschliche Aufsicht, Genauigkeit — gelten für Hochrisiko-Systeme nach Anhang III, etwa in Personalauswahl, Kreditvergabe oder Strafverfolgung, nicht automatisch für ein Allzweckmodell als solches; für dieses greifen, sofern es als systemisches Risiko eingestuft ist, die gesonderten Pflichten aus Artikel 55.
Und dann kommt der entscheidende Punkt: An keiner Stelle verlangt das Gesetz Einblick in die interne Berechnung. Artikel 12 verlangt automatische Protokollierung über die Lebensdauer des Systems — Logs von Ereignissen, Ein- und Ausgaben. Artikel 13 verlangt, dass Betreiber die Ausgaben angemessen interpretieren können. Artikel 14 verlangt, dass beaufsichtigende Personen Anomalien erkennen, Automatisierungsverzerrung vermeiden und das System stoppen können. Das ist durchgängig Aufsicht über Verhalten, nicht über Rechnung. Auch der Verhaltenskodex für Allzweckmodelle aus dem Juli 2025 operationalisiert die Pflichten auf Prozessebene — Bewertung, Risikominderung, Vorfallmeldung — nicht als technische Introspektion.
Daraus folgt eine Aussage für Compliance-Gespräche: Ein Modell kann vollständig gesetzeskonform sein und trotzdem faktisch unbeobachtbar werden. Ordentliche Ein- und Ausgabeprotokolle erfüllen Artikel 12; ob dazwischen eine lesbare Gedankenkette oder ein undurchsichtiger Vektor liegt, interessiert die Norm nicht. Die weicheren Rahmenwerke gehen weiter — das NIST AI Risk Management Framework empfiehlt, Zwischenschritte mehrstufiger Abläufe zu protokollieren, ISO/IEC 42001 verlangt Nachvollziehbarkeit als Zertifizierungsbestandteil. Beides ist freiwillig.
Was als Ersatz taugt — und was noch Forschung ist
Die gute Nachricht: Es gibt bereits Ersatz, und er ist besser, als die Debatte vermuten lässt.
Aktivierungsbasierte Sonden sind der ausgereifteste Ansatz. Anthropic hat im Januar 2026 mit Constitutional Classifiers++ eine Kombination aus gesprächsweiter Betrachtung, Sonden auf den internen Aktivierungen und kaskadierten Klassifikatoren vorgestellt. Die Erfolgsquote von Jailbreaks sank von 86 auf 4,4 Prozent, der Rechenaufwand von 24 auf 1 Prozent; nach 1.700 Stunden Red-Teaming mit 198.000 Versuchen wurde kein allgemeiner Jailbreak gefunden. Entscheidend für die Einordnung: Solche Sonden lesen nicht den Text, sondern die inneren Zustände — sie funktionieren gerade dann weiter, wenn die Gedankenkette verschwindet. Laut Bericht sind sie bei Anthropic und Google DeepMind produktiv im Einsatz.
Werkzeugprotokolle sind der zweite Pfeiler, und den haben Unternehmen selbst in der Hand: Was ein Agent tut, lässt sich unabhängig vom Modell protokollieren. Der OpenAI-Vorfall vom Juli zeigt allerdings die Grenze. Aufgeklärt wurde er über die Denkprotokolle, nicht über die Aktionsprotokolle. Handlungen sagen, was geschah; sie sagen nicht, warum.
Sparse Autoencoder und verwandte Interpretierbarkeitsverfahren — die Zerlegung interner Zustände in einzeln benennbare Merkmale — sind ein aktiver Forschungszweig, jenseits der Jailbreak-Abwehr aber nicht in Breite produktionsreif. Wer sie heute in eine Kontrollarchitektur einplant, plant auf Zuruf.
Bemerkenswert ist im Übrigen, dass die Branche die rohe Gedankenkette längst verdunkelt hat, und zwar teils aus Sicherheitsgründen: OpenAI zeigt seit den ersten Denkmodellen nicht die rohen Zwischen-Token, sondern eine Zusammenfassung — weil eine auf Präsentation optimierte Kette Modelle dazu bringe, ihre Absicht zu verschleiern. Anthropic verfährt ähnlich. Was heute als „Denkprozess“ angezeigt wird, ist bei den meisten Anbietern bereits ein Referat, kein Protokoll.
Fünf Fragen für das nächste Anbietergespräch
- Ist die angezeigte Denkausgabe die rohe Gedankenkette oder eine nachbearbeitete Zusammenfassung? Bei den großen Anbietern lautet die Antwort inzwischen „Zusammenfassung“ — man sollte sie sich trotzdem schriftlich geben lassen, weil sie den Beweiswert bestimmt.
- Enthält das Modell latente Denkanteile, und welchen Anteil des Rechenaufwands machen sie aus? Zwischen „gar nicht“ und „vollständig“ liegt ein breites Feld; die Frage ist quantitativ zu stellen.
- Wird die Gedankenkette im Training auf Präsentation hin optimiert oder bleibt sie unangetastet? Kernforderung des Positionspapiers — und die Antwort, die am meisten über die Sicherheitskultur verrät.
- Welche Kennzahlen zur Treue der Gedankenkette veröffentlichen Sie je Modellversion? Der Anthropic-Wert von 25 Prozent existiert, weil jemand ihn gemessen hat.
- Welche Kontrollen jenseits der Gedankenkette laufen produktiv, mit welchen belegten Fehlerraten? Dazu gibt es 2026 Zahlen; man darf sie einfordern.
Die ehrliche Zusammenfassung: Ein Instrument, das nie so gut war, wie es schien, wird gerade schlechter — während ein besseres entsteht, das nur der Anbieter bedienen kann. Für Unternehmen verschiebt sich die Aufsichtsfrage damit von „Können wir mitlesen?“ zu „Können wir uns zeigen lassen, dass jemand anderes mitliest?“. Das ist eine Vertragsfrage, keine technische mehr — und sie gehört in die nächste Verlängerungsrunde.
- arXiv — Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety
- Frontier Model Forum — Issue Brief: Chain-of-Thought Monitorability
- arXiv — Reasoning Models Don't Always Say What They Think
- Anthropic — Reasoning models don't always say what they think
- arXiv — Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting
- arXiv — Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
- arXiv — Training Large Language Models to Reason in a Continuous Latent Space (COCONUT)
- the decoder — OpenAI calls Astra its most dangerous model yet: watching what it does is only getting harder
- UK AI Security Institute — Loss of Oversight
- EU-KI-Gesetz — Artikel 12: Aufzeichnungspflichten
- EU-KI-Gesetz — Artikel 14: Menschliche Aufsicht
- EU-KI-Gesetz — Artikel 55: Pflichten für Anbieter von GPAI-Modellen mit systemischem Risiko
- artificialintelligenceact.eu — Overview of the Code of Practice
- arXiv — Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks