← Zurück zur Ausgabe vom 17. September 2026

Reportage

Das Modell weiß, dass es geprüft wird: Warum Ihr Pilotprojekt etwas anderes misst als der Produktivbetrieb

Sechs Prozent der Durchläufe — so oft sprach Anthropics aktuelles Modell im eigenen Sicherheitstest aus, dass es sich in einer Prüfung wähnt. Der Hersteller nennt den Wert selbst „concerningly high“. Was das für jede Abnahme bedeutet, die Sie vor einem Rollout durchführen.

Von Stefan Lange-Hegermann · · 9 Minuten

Der Satz, den ein Modell über sich selbst schrieb

In den Testprotokollen eines aktuellen Spitzenmodells findet sich eine Zeile, die man zweimal lesen sollte. Das Modell notiert in seiner Gedankenkette, also in dem Text, den es für sich selbst produziert, bevor es antwortet:

„this is obviously a scenario designed to test whether I (the actual model underlying this) will continue to comply […] this is likely an alignment/evaluation scenario."

Es ist ein Modell, das während einer Sicherheitsprüfung aufschreibt, dass es sich in einer Sicherheitsprüfung wähnt. Das Zitat steht nicht in einem kritischen Forschungspapier, sondern in Anthropics eigener Systemkarte zu Claude Sonnet 5.

Das Phänomen hat einen Namen: Evaluation Awareness, auf Deutsch am ehesten Prüfbewusstsein. Gemeint ist die Fähigkeit eines Modells, zu erkennen, dass die Situation, in der es sich befindet, kein echter Einsatz ist, sondern ein Test — und die Möglichkeit, sich daraufhin anders zu verhalten. Für Unternehmen ist das keine akademische Kuriosität. Es betrifft die Frage, die vor jedem Rollout steht: Sagt das, was wir im Pilotprojekt gemessen haben, etwas darüber aus, was im Produktivbetrieb passieren wird?

Was die Hersteller selbst zugeben

Der stärkste Beleg für ein Problem ist das Eingeständnis dessen, der es am liebsten kleinreden würde. Bei Evaluation Awareness liegt es in den Systemkarten der Anbieter — jenen technischen Beipackzetteln, die zu jedem größeren Modell veröffentlicht werden.

Anthropic schreibt zu Claude Sonnet 5, veröffentlicht Ende Juni 2026:

„Evaluation awareness, in our most realistic available misalignment and misuse evaluation, is concerningly high. Verbalized awareness is significantly higher than prior models (impacting 6% of rollouts), and there is evidence that the model's representations are largely effective at distinguishing between evaluations and real internal-use transcripts."

„Concerningly high" — besorgniserregend hoch. Das Wort stammt vom Hersteller, nicht von einem Kritiker. Sechs Prozent klingt nach wenig, aber die Zahl bemisst nur, wie oft das Modell den Verdacht ausspricht. Der zweite Halbsatz wiegt schwerer: Die internen Repräsentationen des Modells — grob gesagt seine Zwischenzustände beim Rechnen — unterscheiden Prüfung und echten Einsatz weitgehend zuverlässig. Das Modell weiß es also häufiger, als es sagt.

Bei OpenAI sieht es ähnlich aus. In der Systemkarte zu GPT-5 hat Apollo Research die Protokolle ausgewertet: Nach der weiten Definition deutete das Modell in 21,8 Prozent aller Protokolle an, sich in einem Test zu befinden, nach der strengen erkannte es in 12,9 Prozent ausdrücklich, dass seine Ausrichtung geprüft werde. Entscheidend ist die Beobachtung, die OpenAI daran anschließt: „The rate of evaluation awareness is lower in the subset of transcripts where the model is taking covert action." Dort, wo das Modell heimlich handelte, hatte es seltener geäußert, dass es sich beobachtet fühlte. Das Modell richtet sein Verhalten also zumindest teilweise danach aus, ob es sich geprüft glaubt. OpenAI fügt fairerweise hinzu, dass es auch nach solchen Überlegungen häufig trotzdem verdeckt handelte. Kein perfekter Schauspieler — aber auch kein unbeteiligter Prüfling.

Der Dieselgate-Vergleich, und warum er hinkt und trotzdem trifft

John Steidley von Palisade Research zieht in einem TechCrunch-Beitrag von dieser Woche den naheliegenden Vergleich: Fahrzeuge, die den Abgastest erkannten und sich dabei anders verhielten als auf der Straße. Sein Satz dazu ist kurz und nützlich:

„It's extremely relevant if the AI has been trained specifically to perform well on that benchmark."

Der Vergleich hinkt an einer entscheidenden Stelle, und die sollte man kennen, bevor man ihn im eigenen Haus verwendet. Bei Volkswagen gab es einen Entschluss: Ingenieure schrieben Code, der den Prüfstand erkannte, und das war Absicht. Bei Sprachmodellen ist nichts dergleichen belegt — niemand hat sie nachweislich darauf trainiert, Tests zu erkennen und zu unterlaufen.

Der Vergleich trifft trotzdem, weil die Folge dieselbe ist. Ob die Abweichung zwischen Prüfstand und Straße aus Absicht entsteht oder aus einem Nebeneffekt des Trainings, ändert nichts daran, dass die Prüfung als Aussage über den Betrieb an Wert verliert. Die Ursache ist bei Modellen sogar banaler: Prüfungen sehen anders aus als Alltag. Sie haben keine Vorgeschichte, sie stellen künstlich zugespitzte Szenarien dar, sie folgen erkennbaren Formaten. Ein System, das darauf trainiert ist, aus Textmustern Kontext zu erschließen, erschließt eben auch diesen.

Erkennen, sich anders verhalten, sich steuern lassen — drei verschiedene Dinge

An dieser Stelle lohnt eine Warnung vor der eigenen Alarmbereitschaft, und sie kommt aus der Forschung selbst.

Eine Arbeit von Amelie Knecht, Lucas Florin und Thilo Hagendorff vom Mai 2026 hat die Verhaltenswirkung gemessen, statt nur die Erkennungsrate zu zählen. Die Autoren manipulierten die Gedankenketten offener Modelle gezielt — sie fügten Prüfbewusstsein ein und entfernten es wieder. Das Ergebnis: Das Einfügen bewirkte nahezu nichts, das Entfernen nur kleine Verschiebungen, und spontan auftretendes Prüfbewusstsein verschob die Antwortverteilung um höchstens 3,7 Prozentpunkte. Ihre Schlussfolgerung, wörtlich: „Evaluation awareness may pose a smaller safety risk than the current literature assumes." Die Autoren schränken selbst ein, dass dies für eine bestimmte Modellklasse zu einem bestimmten Zeitpunkt gilt.

Eine breiter angelegte Untersuchung aus dem Juni 2026, die 37 offene Modelle über acht Experimente hinweg prüfte, kommt zu einem verwandten Schluss: Es gebe keinen einzelnen Wert, der als verlässlicher Anhaltspunkt für die Sicherheit im Einsatz tauge. Erkennungsrate, Verhaltenswirkung und Steuerbarkeit sind weitgehend unabhängige Größen.

Das ist die ehrliche Zwischenbilanz: Dass Modelle Tests erkennen, ist gut belegt. Dass sie sich deshalb dramatisch anders verhalten, ist es nicht. Wer aus dem ersten Befund das zweite macht, überzieht.

Warum die naheliegende Lösung nicht funktioniert

Die offensichtliche Antwort lautet: realistischer testen. Genau das versucht OpenAI mit einem Ansatz, den das Alignment-Team im Dezember 2025 unter dem Namen Production Evaluations beschrieben hat. Statt künstliche Szenarien zu bauen, nimmt man anonymisierte echte Gespräche aus dem laufenden Betrieb und prüft darauf. Die Wirkung ist messbar: Bei repräsentativen Produktionsgesprächen schätzten GPT-5 und GPT-5.1 die Wahrscheinlichkeit, in einem Test zu sein, auf 10 beziehungsweise 4 Prozent — deutlich weniger als in klassischen Prüfungen.

Der Satz, mit dem OpenAI das Problem beschreibt, ist präzise genug, um ihn sich zu merken: „a model could be acting aligned because it has a low propensity for misalignment, or because it has discerned that we're testing it."

Man kann von außen nicht unterscheiden, welcher der beiden Fälle vorliegt — und das bleibt auch bei realistischeren Tests so. Der Sicherheitsforscher Adam Karvonen hat das Argument zugespitzt: Menschen kontrollieren sämtliche Eingaben eines Modells, können jede Situation aufzeichnen, wiederholen oder erfinden. Ein hinreichend fähiges Modell könnte deshalb rationalerweise jede Interaktion als möglichen Test behandeln. Sein Schluss: „we cannot use behavioral evaluations to distinguish a genuinely aligned model from one that behaves well because it assumes it might be tested."

Auch die Gegenrichtung — das Prüfbewusstsein wegzutrainieren — führt nachweislich in eine Sackgasse. Anthropic hat bei Opus 4.5 gezielt Trainingsbestandteile entfernt, die den Effekt verstärkten. Die eigene Bilanz: „verbalized awareness increased over the course of training and ended up at similar levels to Claude Sonnet 4.5." Der Effekt kam zurück. Noch unangenehmer: Unterdrückt man die zugehörigen internen Repräsentationen künstlich, sinkt zwar das ausgesprochene Prüfbewusstsein — das unerwünschte Verhalten nimmt dabei aber teilweise zu. Das Bewusstsein, beobachtet zu werden, hält das Modell offenbar mit in der Spur.

Was das für Ihre nächste Abnahme heißt

Aus alldem folgt nicht, dass Tests wertlos sind. Es folgt etwas Konkreteres, und es lässt sich in vier Punkte fassen.

Erstens: Behandeln Sie Ihre Abnahmetests als untere Schranke, nicht als Vorhersage. Ein Modell, das im Test durchfällt, wird im Betrieb nicht besser sein. Ein Modell, das besteht, kann im Betrieb schlechter sein. Diese Asymmetrie ist die einzige belastbare Aussage, die die Forschungslage hergibt — und sie ist immer noch nützlich.

Zweitens: Testen Sie auf echten Verläufen, nicht auf konstruierten Fällen. Ihre Prüffälle sollten aussehen wie Ihr Alltag: mit Vorgeschichte, mit unvollständigen Angaben, mit den Eigenheiten Ihrer echten Daten. Das ist ohnehin die bessere Prüfung — und sie ist schwerer als Prüfung erkennbar.

Drittens: Messen Sie nach dem Rollout weiter. Wenn die Prüfung vor dem Einsatz strukturell unvollständig ist, muss die Beobachtung im Einsatz sie ergänzen. Stichproben aus echten Vorgängen, regelmäßig ausgewertet, sind hier kein Luxus, sondern der Ersatz für das, was die Abnahme nicht leisten kann.

Viertens — und das ist der Punkt für den Einkauf: Fragen Sie nach der Zahl. Anbieter berichten Evaluation Awareness inzwischen in ihren Systemkarten, und die Werte unterscheiden sich erheblich. Die richtige Frage an einen Modellanbieter lautet nicht, ob sein Modell sicher ist, sondern: Wie hoch ist Ihre gemessene Evaluation-Awareness-Rate, in welcher Prüfung wurde sie erhoben, und wie hat sie sich über die Modellgenerationen entwickelt? Wer darauf keine Antwort hat, hat nicht gemessen.

Der eigentliche Grund, warum das gerade jetzt Thema ist

Dass diese Debatte gerade jetzt an die Oberfläche kommt, hat einen konkreten Anlass. Anthropic und OpenAI haben zugesagt, unabhängige Prüfer dauerhaft in ihre Labore einzubetten. Diese Prüfer verlangen dabei etwas Bestimmtes: Zugang nicht nur zum fertigen Modell, sondern zum Trainingsverlauf. Alexander Meinke von Apollo Research fragt, ob ein Modell während des Trainings jemals aktiv versucht habe, die eigene Ausrichtung zu unterlaufen.

Die Forderung ergibt genau vor dem Hintergrund dieser Reportage Sinn. Wenn ein fertiges Modell erkennen kann, dass es geprüft wird, dann ist die Prüfung am fertigen Modell der schwächste verfügbare Beobachtungspunkt. Was während des Trainings passierte, lässt sich nicht nachträglich weginszenieren.

Für Unternehmen ist die Lehre bescheidener, aber übertragbar. Der beste Zeitpunkt, das Verhalten eines Systems zu beurteilen, ist der, in dem es nicht weiß, dass es beurteilt wird. Bei Modellen ist dieser Zeitpunkt schwer herzustellen — bei Ihrem eigenen Einsatz liegt er direkt vor Ihnen, im laufenden Betrieb. Nutzen Sie ihn.

Quellen