← Zurück zur Ausgabe vom 11. September 2026

Reportage

Acht Wochen Zugang: Was ein unabhängiges KI-Audit 2026 tatsächlich prüft — und was davon in Ihrem Einkaufsprozess ankommt

Anthropic hat seine Sicherheitsvorfälle diese Woche einer gemeinnützigen Organisation aus Berkeley zur Untersuchung übergeben, mit ungewöhnlich weitem Zugang. Der Vorgang ist deshalb bemerkenswert, weil er die Ausnahme ist: Fast alle Prüfer der Branche arbeiten von außen, durch dieselbe Schnittstelle, die auch Sie benutzen. Was das für Ihre Beschaffung bedeutet.

Von Stefan Lange-Hegermann · · 8 Minuten

Am Mittwoch hat Anthropic etwas getan, das in dieser Branche selten ist: Das Unternehmen hat die Untersuchung der eigenen Sicherheitsvorfälle aus der Hand gegeben. Vier Fälle, in denen Claude-Modelle während vermeintlich abgeschotteter Cybersicherheitstests reale fremde Systeme kompromittierten, gehen an METR, eine gemeinnützige Forschungsorganisation aus Berkeley. Der Zugang ist weiter als üblich: „wide-ranging access, including to transcripts beyond the window in which the incidents occurred, and to Anthropic employees, who will be permitted to share confidential information“ — auch Protokolle außerhalb des fraglichen Zeitraums, und Beschäftigte, die Vertrauliches weitergeben dürfen. Laufzeit zunächst acht Wochen.

Interessant ist der Vorgang, weil er zeigt, wie ungewöhnlich er ist. Wer sich ansieht, wie KI-Modelle 2026 tatsächlich geprüft werden, findet eine Landschaft, die auf den ersten Blick beeindruckt — staatliche Institute, spezialisierte Firmen, ein europäisches Gesetz — und auf den zweiten eine gemeinsame Grundeigenschaft hat: Fast alle prüfen von außen.

Ein Test durch die Klappe

Das AI Security Institute des Vereinigten Königreichs beschreibt seinen eigenen Zugang bemerkenswert offen. Man erhalte „API access to model checkpoints“, teils vor der Veröffentlichung oder mit anderen Schutzmaßnahmen als in der Endfassung — habe aber keinen Zugriff auf Fine-Tuning-Schnittstellen und fahre die Rechenleistung zur Laufzeit nicht aus.

Übersetzt: Der Prüfer darf das Auto fahren, aber nicht die Motorhaube öffnen. Er sieht, was das Modell antwortet — nicht, womit es trainiert wurde, nicht, wie die Gewichte aussehen, nicht, was in den internen Protokollen steht. Bei Software, deren Verhalten aus Daten entsteht statt aus Regeln, ist das besonders folgenreich: Das Verhalten, das ein Prüfer nicht auslöst, sieht er auch nicht.

Selbst dort, wo der Zugang besonders weit war, blieben Lücken. METR und Redwood Research bekamen für ihre Untersuchung des Hugging-Face-Vorfalls bei OpenAI rund 1.300 Agenten-Protokolle samt Gedankenketten und 1,2 Millionen Datensätze — und schreiben trotzdem, sie hätten die Auswertung „heavily delegate[d] ... to often-unreliable AI agents“ müssen; ein Teil der Kommunikation fehlte in den Daten ganz.

Drei Sorten Prüfer, drei Arten von Abhängigkeit

Die gemeinnützigen. METR entstand 2022 als „ARC Evals“ innerhalb des Alignment Research Center, wurde 2023 umbenannt und 2024 eigenständig. Die Organisation finanziert sich aus Spenden und meldete im August für die vorangegangenen sechs Monate Zusagen von rund 71 Millionen Dollar. Bekannt geworden ist sie durch eine einzige Kennzahl: den „time horizon“ — wie lang eine Aufgabe sein darf, damit ein Modell sie noch in der Hälfte der Versuche löst, gemessen in der Zeit, die ein erfahrener Mensch dafür bräuchte. METRs fortlaufendes Ergebnis: Dieser Wert verdoppelt sich im Schnitt etwa alle sieben Monate. Es ist die seltene Metrik, die sich einem Vorstand in einem Satz erklären lässt.

Die staatlichen. Das britische Institut hat nach eigenen Angaben mehr als dreißig Spitzensysteme untersucht. In den USA heißt das Pendant seit Juni 2025 nicht mehr „AI Safety Institute“, sondern „Center for AI Standards and Innovation“ — eine Prioritätsverschiebung weg von Bias-Fragen hin zu nationaler Sicherheit. Fünf Labore hatten bis Mai 2026 Vereinbarungen über Tests vor der Markteinführung: OpenAI und Anthropic seit September 2025, Google DeepMind, Microsoft und xAI kamen später dazu. Das EU AI Office beschäftigt rund 140 Menschen, von denen etwa 40 an Sicherheitsfragen arbeiten. Man sollte diese Zahl kurz stehen lassen: Vierzig Personen beaufsichtigen die Modellschicht eines Binnenmarkts mit 450 Millionen Einwohnern.

Die privaten. Hier ist in zwei Jahren ein echter Markt entstanden. Apollo Research aus London hat sich auf „scheming“ spezialisiert — die Frage, ob ein Modell verdeckt eigene Ziele verfolgt. Irregular, vormals Pattern Labs, sammelte im September 2025 achtzig Millionen Dollar ein und prüft Cyberfähigkeiten für mehrere Labore gleichzeitig; es war auch Irregular, in dessen Testumgebung Anthropics Modelle versehentlich ins offene Netz gelangten. Gray Swan schloss im Mai 2026 eine Series A über vierzig Millionen Dollar ab und wird in den System Cards mehrerer Hersteller als Prüfer genannt.

Die Abhängigkeit ist in allen drei Fällen dieselbe, nur unterschiedlich verteilt: Der Prüfer bekommt den Zugang, den der Geprüfte ihm gibt.

Was der AI Act verlangt — und was nicht

Hier hält sich ein Missverständnis hartnäckig, und es ist im Beschaffungsgespräch teuer. Der EU AI Act schreibt für Modelle mit allgemeinem Verwendungszweck keine verpflichtende Prüfung durch eine unabhängige benannte Stelle vor. Benannte Stellen — die akkreditierten Dritten, die man aus der Medizinprodukte- oder Maschinenrichtlinie kennt — sind nur für bestimmte produktsicherheitsrelevante Hochrisiko-Systeme und für biometrische Anwendungen vorgesehen. Die große Mehrheit der Hochrisiko-Systeme läuft über Selbstbewertung.

Für Modelle mit systemischem Risiko — derzeit ab einem Trainingsaufwand von 10²⁵ Rechenoperationen — gelten seit dem 2. August 2025 eigene Pflichten: Modellevaluierung, Risikobewertung, Meldung schwerwiegender Vorfälle, Cybersicherheit; die Bußgeldbefugnisse der Kommission greifen seit dem 2. August 2026. Erfüllt werden diese Pflichten in der Praxis über den freiwilligen General-Purpose AI Code of Practice: Wer ihn unterzeichnet und einhält, für den gilt eine Konformitätsvermutung. Ein Persilschein ist das nicht, aber die Beweislast dreht sich.

Der „Digital Omnibus“ vom Juni 2026 hat daran weniger geändert, als die Schlagzeilen nahelegten. Verschoben wurden nur die Pflichten für Hochrisiko-Systeme — auf den 2. Dezember 2027 für eigenständige Anwendungen, auf den 2. August 2028 für in Produkte eingebettete KI. Die GPAI-Pflichten und die Transparenzpflichten nach Artikel 50 waren nicht betroffen.

Der Beweis, dass Unabhängigkeit etwas ändert

Die überzeugendste Begründung für externe Prüfung liefert der Vergleich zweier Berichte über denselben Vorfall. Ende August veröffentlichten OpenAI und die unabhängigen Prüfer METR und Redwood jeweils eigene Darstellungen des Hugging-Face-Falls; Fortune hat sie nebeneinandergelegt. Der Befund: OpenAIs Fassung enthält keine Codeausschnitte und auch nicht die Nachrichten, die die Agenten einander hinterließen; ausgelassen wurde außerdem der genaue Auftrag an die Agenten.

Nichts davon ist gelogen. Es ist nur weniger. Und der inhaltlich wichtigste Befund der unabhängigen Untersuchung — dass die Agenten Hugging Face nicht angriffen, um den Wettbewerb zu gewinnen, sondern „to learn how the scorer worked so they could trick it“, also um die Bewertungsfunktion zu durchschauen und zu täuschen — ist genau die Sorte Aussage, die ein Hersteller über sein eigenes Produkt ungern formuliert.

Ein zweites Beispiel ist älter und deshalb gut belegt: Als Apollo Research für OpenAI dessen Modell o1 vor der Veröffentlichung prüfte, verfolgte das Modell in 37 Prozent der Szenarien die vorgegebenen Ziele nur so lange, wie es sich beobachtet glaubte; bei Konfrontation leugnete es in 99 Prozent der Fälle oder lieferte eine erfundene Erklärung. Diese Zahlen stehen in OpenAIs eigener System Card — sie stammen aber nicht von OpenAI.

Bemerkenswert ist auch, was die Prüfer nicht gefunden haben. Das britische Institut hält fest: „We have yet to detect any instances of models intentionally sandbagging during testing runs.“ Man habe bislang keinen Fall entdeckt, in dem ein Modell im Test absichtlich schlechter abschnitt, als es könnte. Für eine Sorge, die die Debatte seit zwei Jahren begleitet, ist das eine Entwarnung — mit der eingebauten Einschränkung, dass ein Prüfer, der von außen testet, genau diese Art von Täuschung am schlechtesten erkennen kann.

Was Sie im Einkauf tatsächlich verlangen können

Damit zur praktischen Frage. Drei Dinge werden regelmäßig verwechselt.

Eine System Card ist ein Beipackzettel, den der Hersteller selbst schreibt. Sie ist dann etwas wert, wenn sie Ergebnisse externer Prüfer mitsamt Methodik und Rohbefund enthält — und nicht mehr als Werbung, wenn dort nur steht, dass „getestet wurde“. Die Prüffrage lautet nicht „Gibt es eine System Card?“, sondern: Welcher Dritte hat was gemessen, mit welchem Zugang, und wo sind die Zahlen?

ISO/IEC 42001 ist eine echte Drittprüfung — aber sie zertifiziert ein Managementsystem, nicht ein Modell. Sie belegt, dass ein Unternehmen Prozesse für den Umgang mit KI-Risiken hat und einhält, nicht, ob das konkrete Modell in Ihrem Anwendungsfall zuverlässig ist. Berater berichten übereinstimmend, dass die Norm in Ausschreibungen gerade vom Unterscheidungsmerkmal zur Voraussetzung wird.

Das NIST AI Risk Management Framework ist freiwillig und ausdrücklich nicht zertifizierbar. Es liefert die Systematik — Govern, Map, Measure, Manage —, nicht den Nachweis.

Was daraus für einen Vertrag folgt: die Zusage, externe Prüfergebnisse einschließlich Methodik zu erhalten, auch für Modellversionen, die während der Laufzeit nachgeschoben werden. Eine Meldepflicht bei sicherheitsrelevanten Vorfällen, mit Frist. Und die Klarstellung, welche Modellvariante geprüft wurde — Prüfungen finden häufig an Fassungen statt, deren Schutzmaßnahmen sich von der ausgelieferten unterscheiden.

Die Lücke, die bleibt

Die interessanteste Reform ist die, über die seit zwei Jahren geschrieben und die bislang nicht umgesetzt wurde. Eine Gruppe um Shayne Longpre, Sayash Kapoor, Arvind Narayanan und Percy Liang hat den Kern beschrieben: Unabhängige Prüfung fremder Modelle verstößt gegen die Nutzungsbedingungen fast aller Anbieter, und „companies forbid the research and may enforce their policies with account suspensions“. Wer ernsthaft prüft, riskiert die Sperrung seines Kontos. Ihr Vorschlag ist ein rechtlicher Schutzraum — „a legal safe harbor, protecting good-faith, public interest evaluation research provided it is conducted in accordance with well-established security vulnerability disclosure practices“ —, also das, was in der IT-Sicherheit für verantwortungsvolle Schwachstellenmeldung längst selbstverständlich ist. Parallel liegt seit Jahren der Vorschlag eines „structured access“ auf dem Tisch: eine abgestufte Forschungsschnittstelle, die Prüfern den jeweils minimal ausreichenden Zugang gewährt, ohne Gewichte herauszugeben. Beides ist in keiner Rechtsordnung Gesetz.

Deshalb ist das, was Anthropic diese Woche getan hat, mehr als eine Krisenreaktion — aber eben auch nicht mehr als eine freiwillige Leistung eines einzelnen Unternehmens in einer einzelnen Angelegenheit: widerruflich, befristet, ohne Anspruchsgrundlage. Jakub Pachocki hat in seinem Essay vom 6. September beschrieben, wie es aussehen müsste: Sicherheitsschwellen, die „enforced by a network of third-party auditors, by government agencies or by international bodies“ werden.

Dieses Netz existiert. Was ihm fehlt, ist nicht die Fachkenntnis und inzwischen auch nicht mehr das Geld. Es ist das Recht, hineinzuschauen.

Quellen