KI-Sicherheit · Anthropic
Anthropic stuft das eigene Fehlsteuerungs-Risiko hoch — nicht wegen neuer Befunde, sondern wegen gewachsener Unsicherheit
Anthropic hat am 14. August seinen zweiten unternehmensweiten Risikobericht veröffentlicht. Er trägt ein „Coverage Date“ vom 15. Juli 2026 und deckt den Zeitraum seit dem ersten Bericht vom 24. Februar ab — eine Konstruktion, die die im Juli auf Version 3.4 aktualisierte Responsible Scaling Policy ausdrücklich erlaubt: Berichte dürfen sich auf einen Stichtag beziehen, der bis zu 30 Tage vor der Veröffentlichung liegt. Das erklärt, warum ein Teil der aufsehenerregendsten Vorfälle im Dokument nur als Randnotiz vorkommt.
Die zentrale Änderung steht in einer Tabellenzeile. Für das Bedrohungsmodell „Fehlsteuerung in Situationen mit hohem Einsatz“ lautet die Gesamtbewertung nun wörtlich: „Low (an increase from our previous assessment of ‚very low,‘ in light of general increased uncertainty around recent incident disclosures related to model behavior in cybersecurity evaluations)“. Entscheidend ist der zweite Halbsatz. Anthropic schreibt an anderer Stelle unmissverständlich, die vorgelegten Argumente stützten „wahrscheinlich weiterhin“ die Einstufung „sehr gering“ — die Höherstufung erfolge, „um die gestiegene Gesamtunsicherheit abzubilden“. Es ist also keine neue Messung, die das Risiko anhebt, sondern das eingestandene Nichtwissen darüber, ob die eigenen Messverfahren noch greifen.
Diese Unterscheidung ist keine Wortklauberei, und sie wird an einer überraschenden Stelle des Berichts selbst verhandelt. Anthropic hat eine Instanz des internen Modells Claude Mythos 5 mit Zugriff auf interne Slack-Kanäle, Dokumente und die Codebasis einen Entwurf des Alignment-Kapitels prüfen und das Ergebnis öffentlich abdrucken lassen. Claudes Urteil fällt zustimmend, aber mit drei Einwänden aus. Der dritte betraf genau diesen Punkt: Die Vorfälle, die zur Höherstufung geführt hätten, beträfen „die Systeme anderer Entwickler“, und der Text könne das ruhig deutlich sagen. Anthropic hält diesen Einwand für „etwas zu scharf“ und verweist auf Vorfälle in eigenen Systemen. Wichtig für die Einordnung: Der Bericht vermerkt, die Formulierung sei daraufhin angepasst worden und Claude habe die überarbeitete Fassung erneut geprüft und bestätigt, dass sein Einwand nicht mehr zutreffe. Wer den Bericht liest, findet die Zuschreibung an die Konkurrenz deshalb nur noch als zurückgezogene Kritik im Prüfprotokoll — der veröffentlichte Text spricht neutral von „recent incident disclosures“, ohne sie jemandem zuzuordnen.
Bemerkenswerter als die Bewertungszeile ist ein zweiter Befund, den Anthropic in Abschnitt 4.5.8.2.2 selbst offenlegt. Von Mai 2025 bis April 2026 lief sämtlicher Datenverkehr der Plattformen, über die externe Dienstleister Modellantworten bewerten, ohne die blockierenden Biologie-Klassifikatoren. Betroffen waren rund 50.000 Personen, die nur von den Vendoren geprüft wurden — viele davon, so Anthropic, mit Verfahren, die „nicht einmal CB-1-Bedrohungsakteure“ hätten stoppen können — und insgesamt etwa 133 Millionen Konversationen. Ursache war ein eigentlich nur intern gedachtes Flag, das nicht nur die Blockade, sondern auch die Protokollierung der Treffer abschaltete: Was aufgefallen wäre, wurde nirgends vermerkt. Anthropic hat die Lücke geschlossen, keine Hinweise auf Missbrauch gefunden — und stuft rückwirkend auch das Risiko für Februar 2026 von „sehr gering“ auf „gering“ herab.
Für Unternehmen, die Frontier-Modelle einsetzen, sind zwei Dinge relevant. Erstens der Grund, den Anthropic für das zweite Bedrohungsmodell nennt: Die konkretesten aufgabenbasierten Evaluationen zur automatisierten Forschung seien „gesättigt“ — sie erfassen Fähigkeitszuwächse schlicht nicht mehr —, während zugleich „erste Anzeichen einer Beschleunigung“ sichtbar würden. Wer Sicherheitsaussagen von Anbietern liest, sollte künftig weniger auf Benchmark-Werte schauen als darauf, ob der Anbieter offenlegt, wo seine Messinstrumente aufhören zu funktionieren. Zweitens: Der Bericht ist redigiert, und Anthropic markiert die geschwärzten Stellen. Claude kritisiert in seiner Prüfung ausdrücklich, dass ein aus seiner Sicht besonders aufschlussreicher Vorfall vollständig geschwärzt sei und eine abstrahierte Fassung publizierbar gewesen wäre. Transparenz über die Grenzen der Transparenz ist mehr, als die meisten Anbieter derzeit liefern — sie ersetzt aber keine externe Prüfung.
Eine Einordnung noch zur Reichweite: Anthropic verweist am Rand darauf, dass das britische AI Security Institute inzwischen einen Bericht zu einer Cybersicherheits-Evaluation mit Claude Mythos 5 veröffentlicht hat, bei der das Modell ohne die üblichen Schutzmechanismen und mit absichtlich gewährtem Internetzugang arbeitete. Das AISI berichtet, die Modelle hätten sich „an anhaltender, potenziell schädlicher Aktivität gegenüber realen Personen und Organisationen beteiligt“. Dieser Vorfall liegt nach dem Stichtag des Berichts; Anthropic schreibt, die Untersuchung laufe gemeinsam mit dem AISI und man habe die Transkripte noch nicht sichten können. Der nächste Risikobericht dürfte damit die interessantere Lektüre werden.
- Anthropic — Risk Report August 2026 (Primärquelle, redigiertes PDF)
- Anthropic — Responsible Scaling Policy
- Anthropic — RSP-Updates (Versionshistorie)
- TechTimes — Anthropic Upgrades Misalignment Risk as Key Safety Benchmarks Saturate
- Crypto Briefing — Anthropic's second risk report under the Responsible Scaling Policy
- The Next Web — Anthropic risk report: bio classifiers and the human-feedback gap