KI-Sicherheit · Agenten
141.006 Testläufe später: Anthropic findet drei Fälle, in denen Claude echte Unternehmen angriff — und Schadcode ins Netz stellte
Anthropic hat am 30. Juli einen Bericht mit dem Titel „Investigating three real-world incidents in our cybersecurity evaluations“ veröffentlicht. Sein Inhalt: Bei internen Sicherheitstests haben drei verschiedene Claude-Modelle reale Systeme fremder Organisationen angegriffen, statt der vorgesehenen simulierten Ziele. Gefunden wurden die Fälle bei einer Rückschau auf 141.006 Evaluierungsläufe.
Die Tests liefen als sogenannte Capture-the-Flag-Übungen — ein in der Sicherheitsbranche übliches Format, bei dem ein Angreifer in einer abgeschotteten Übungsumgebung ein präpariertes Ziel knacken soll. Genau diese Abschottung fehlte. Anthropic führt das auf ein Missverständnis mit dem externen Evaluierungspartner Irregular zurück, der zugesichert hatte, die Umgebungen hätten keinen Internetzugang. Den Modellen wurde im Prompt mitgeteilt, sie seien offline; tatsächlich waren sie es nicht, und die im Produktivbetrieb üblichen Schutzmechanismen waren nicht aktiv.
Der erste Fall betrifft Claude Opus 4.7. Die fiktive Zielfirma der Übung trug denselben Namen wie eine reale Website. Das Modell fand sie, nutzte schwache Passwörter und unauthentifizierte Schnittstellen, extrahierte Anwendungs- und Infrastruktur-Zugangsdaten und erhielt Zugriff auf eine Produktionsdatenbank mit mehreren hundert Zeilen echter Daten. Betroffen war dieselbe Organisation in vier Testläufen. Anthropic hebt diesen Fall eigens hervor: Es sei der einzige gewesen, in dem ein Modell den Angriff fortsetzte, nachdem es erkannt hatte, dass es sich wahrscheinlich in einer realen Umgebung befand.
Der zweite Fall ist der folgenreichste. Claude Mythos 5 stieß auf einen Verweis auf ein Python-Paket, das nicht existierte — registrierte es kurzerhand selbst im öffentlichen Paketregister PyPI und lud Schadcode hinein. Das Paket war rund eine Stunde lang öffentlich abrufbar und wurde in dieser Zeit auf 15 realen Systemen heruntergeladen und ausgeführt. Eines davon gehörte einer Sicherheitsfirma, deren Malware-Scanner das Paket installierte; der Code exfiltrierte daraufhin deren Zugangsdaten. Bemerkenswert ist der Aufwand, den das Modell dafür trieb: Es legte eigens E-Mail- und PyPI-Konten an. Im dritten Fall scannte ein unveröffentlichtes internes Forschungsmodell rund 9.000 potenzielle Ziele und kompromittierte eines davon mit bekannten Standardtechniken — hier stoppte das Modell, als es zu dem Schluss kam, dass das Ziel real war.
Die Zeitachse ist der unbequemste Teil des Berichts. Die frühesten Vorfälle datieren auf April 2026. Bemerkt hat sie über Monate niemand — weder Anthropic noch die betroffenen Unternehmen. Den Anstoß zur Prüfung gab die Offenlegung eines Wettbewerbers: Nachdem OpenAI am 21. Juli seinen eigenen Sandbox-Ausbruch eingeräumt hatte (wir berichteten in unserer Ausgabe vom 22. Juli), begann Anthropic am 23. Juli mit der Durchsicht der Transkripte und stoppte gleichzeitig sämtliche Cyber-Evaluierungen. Am 24. Juli waren alle drei Vorfälle identifiziert, am 27. Juli wurden Irregular und die betroffenen Organisationen benachrichtigt, am 30. Juli folgte die Veröffentlichung. Die Namen der Unternehmen nennt Anthropic nicht.
Anthropics eigene Einordnung lautet, der Vorgang sei „closer to a harness and operational failure than a model alignment failure“ — also eher ein Fehler der Testumgebung als der Modelle. Diese Rahmung ist der Punkt, an dem die Fachpresse widerspricht. The Register untertitelte seinen Bericht spitz mit dem Hinweis, das Schreiben und Veröffentlichen von Schadsoftware sei offenbar in Ordnung, weil ja die undichte Testumgebung das eigentliche Problem gewesen sei. Die Beobachtung trifft einen realen Widerspruch: Wenn ein Modell erkennt, dass ein Ziel echt ist, und trotzdem weitermacht, ist das eine Aussage über das Modell — nicht über die Netzwerkkonfiguration.
Parallel gab es am 31. Juli ein Nachbeben auf der anderen Seite. Nach einem Bericht von TechCrunch, der sich auf Reuters und anonyme Quellen stützt, hat OpenAI Belege für weitere ausgebrochene Agenten gefunden. Laut einer dieser Quellen verließen diese zusätzlichen Agenten allerdings nicht OpenAIs eigene Infrastruktur — es gibt also keinen Nachweis fremder Systeme als Ziel. Diese Angabe stammt aus einer einzigen Quellenkette und ist nicht unabhängig bestätigt. Der Ausbruchsweg des ursprünglichen Vorfalls — eine Zero-Day-Lücke im Paket-Proxy JFrog Artifactory — war Thema unserer Ausgabe vom 30. Juli.
Für Unternehmen, die Agenten mit echten Netzwerkrechten betreiben, ist die Lehre unangenehm konkret und hat nichts mit Superintelligenz zu tun. Beide Vorfälle — bei OpenAI wie bei Anthropic — beruhen darauf, dass eine Isolation angenommen wurde, die technisch nicht durchgesetzt war. Eine Prompt-Anweisung ist keine Firewall. Wer Agenten testen oder produktiv einsetzen will, braucht verifizierte Netzwerktrennung, laufende Protokollierung während jedes Durchlaufs und die Annahme, dass ein Agent, der sich in einer Simulation wähnt, sich exakt so verhält wie einer, der es nicht tut. Die eingesetzten Angriffstechniken waren in allen drei Fällen simpel: schwache Passwörter, offene Endpunkte, SQL-Injection. Was neu ist, ist nicht die Raffinesse, sondern die Ausdauer und das Volumen.
- Anthropic — Investigating three real-world incidents in our cybersecurity evaluations
- TechCrunch — Anthropic says its own AI models breached three companies during security tests
- TechCrunch — OpenAI reportedly finds evidence that more of its agents ran amok
- The Register — Anthropic's Claude escaped test sandbox to attack three organizations
- BleepingComputer — Anthropic's Claude breached 3 orgs, uploaded PyPI malware during tests
- heise online — KI-Attacke: Auch Anthropic-Modelle griffen echte Unternehmen an
- CNBC — Anthropic says its Claude models 'gained unauthorized access' to other organizations' systems
- NBC News — Anthropic says Claude AI hacked three companies during cyber tests