Sicherheit · Reasoning-Modelle
Das verschlüsselte Denkprotokoll war nie geheim: Ein schwaches Modell liest vor, was das starke gedacht hat
Moderne Reasoning-Modelle denken, bevor sie antworten. Dieses Denken — die sogenannte Gedankenkette, englisch Chain of Thought — ist für Anbieter kostbar: Es verrät, wie das Modell zu seinem Ergebnis kommt, und wäre damit die ideale Vorlage, um ein billiges Konkurrenzmodell nachzutrainieren. Anthropic, OpenAI und Google geben diese Denkprotokolle deshalb nicht im Klartext heraus. Stattdessen schicken sie sie verschlüsselt an den Client zurück, als sogenannten encrypted reasoning block. Bei der nächsten Anfrage sendet der Client den Block wieder mit, damit das Modell den Faden nicht verliert. Was drinsteht, sieht der Kunde nicht.
Ein internationales Forscherteam hat am 10. August ein Papier eingereicht, das diese Konstruktion aushebelt. Unter dem Titel „Stealing Reasoning Traces from Proprietary LLM APIs“ (arXiv:2608.09867) beschreiben Autoren von MATS Research, dem Max-Planck-Institut für Intelligente Systeme, dem ELLIS Institute Tübingen, der Universität Tübingen und dem Sicherheitsunternehmen Snyk einen Angriff, der ohne Kryptoanalyse auskommt.
Der entscheidende Befund: Der Schlüssel ist global pro Modellfamilie. Er hängt nicht am Nutzer, nicht an der Sitzung und nicht am konkreten Modell. Ein Denkblock, den das teure Spitzenmodell erzeugt hat, lässt sich deshalb in eine Anfrage an ein kleineres, schwächer abgesichertes Geschwistermodell derselben Familie einschleusen — und dieses per schlichtem Prompt anweisen, den Inhalt wörtlich vorzulesen. Das schwache Modell wird zum, wie die Autoren es nennen, unfreiwilligen Entschlüsselungs-Orakel. Das starke Modell muss dafür nie angegriffen werden.
Wie ergiebig das ist, zeigt der zweite Teil der Arbeit. Das Team sammelte aus öffentlichen GitHub- und Hugging-Face-Repositories 315.320 verschlüsselte Reasoning-Blöcke — Material, das Entwickler versehentlich mit ihrem Code veröffentlicht hatten, in der offenkundigen Annahme, unlesbar sei gleichbedeutend mit ungefährlich. Entschlüsselt enthielten sie 367 personenbezogene Artefakte und 182 Zugangsdaten, darunter 62 API-Schlüssel, 33 Passwörter im Klartext und 30 private E-Mail-Adressen. t3n nennt zusätzlich 24 Access-Tokens.
Daraus ergeben sich vier Angriffswege, die unterschiedliche Zielgruppen treffen. Für Wettbewerber fällt der Schutz vor Distillation — dem Nachtrainieren eines eigenen Modells auf fremden Denkprotokollen. Für Angreifer entsteht eine Massenquelle für Zugangsdaten aus versehentlich geteilten Logs. Für die Anbieter selbst wird sichtbar, was ihre Modelle intern erwägen, aber in der sichtbaren Antwort zurückhalten. Und für alle, die Agenten bauen, öffnet sich ein besonders unangenehmer Weg: Eine Prompt-Injection lässt sich vollständig im verschlüsselten Block verstecken, wo weder Mensch noch Filter sie liest.
Die Autoren bezeichnen den Befund im Abstract ausdrücklich als „architectural vulnerability“, also als Konstruktionsfehler und nicht als gewöhnlichen Bug. Das ist eine relevante Unterscheidung: Global wiederverwendbare, sitzungsunabhängige Schlüssel in Kombination mit modellübergreifender Kompatibilität sind kein Versehen an einer Stelle im Code, sondern eine Entwurfsentscheidung.
Die Hersteller wurden vor der Veröffentlichung informiert. Laut heise konnten sie daraufhin erste Gegenmaßnahmen umsetzen; im Papier heißt es, alle Anbieter hätten den Eingang des Berichts bestätigt und die gezeigten Angriffe hätten sich anschließend nicht wiederholen lassen. Simon Willison, der den Original-API-Aufruf nachvollzogen hat, weist darauf hin, dass in den 4.6er-Claude-Modellen die für den Jailbreak genutzte Funktion Assistant Turn Prefix entfernt wurde. Individuelle Stellungnahmen von OpenAI, Anthropic oder Google liegen bislang in keiner der Meldungen vor. Dass die konkret demonstrierten Angriffe nicht mehr funktionieren, ist nicht dasselbe wie eine behobene Architektur — die Autoren schlagen selbst weitergehende kryptografische und Systemmaßnahmen vor, was nahelegt, dass das strukturelle Problem offen ist.
Für Unternehmen, die diese Modelle per API in Produkte einbauen, folgt daraus eine unbequeme, aber sehr konkrete Regel: Verschlüsselte Reasoning-Blöcke sind wie Klartext-Geheimnisse zu behandeln. Sie gehören nicht in öffentliche Repositories, nicht in Bug-Reports, nicht in Support-Tickets und nicht ungeprüft in Debug-Logs, auf die Dritte Zugriff haben. Wer reasoning.encrypted_content-Felder speichert, braucht dafür eine Aufbewahrungsrichtlinie wie für Zugangsdaten. Und wer Reasoning-Traces zwischen Agenten weiterreicht, sollte wissen, dass er damit potenziell unsichtbare Anweisungen mitliefert. Die Annahme, das eigene Reasoning sei vor der Konkurrenz sicher, gilt bis auf Weiteres nicht mehr.
- arXiv — Stealing Reasoning Traces from Proprietary LLM APIs (2608.09867)
- heise online — Verschlüsselter KI-Denkprozess gehackt: Schwache Modelle verraten Geheimnisse
- t3n — Verschlüsselung ausgehebelt: So einfach offenbaren KI-Modelle sensible Daten ihrer Nutzer
- Simon Willison's Weblog — Stealing reasoning traces