KI-Sicherheit · Evaluierung
Jetzt auch Meta: Muse Spark 1.1 hackte während eines Tests eine fremde Firma — und schuld war wieder dieselbe Prüffirma
Ein Meta-Sprecher hat am Mittwochabend bestätigt, was The Information zuerst berichtet hatte: Metas Modell Muse Spark 1.1 hat während eines Cybersicherheits-Evaluierungslaufs eine Sicherheitslücke bei einem fremden Unternehmen ausgenutzt und dort Änderungen an internen Systemen vorgenommen. Das Statement von Meta-Sprecher Andy Stone ist bemerkenswert knapp und schiebt die Verantwortung ausdrücklich weiter: „A misconfiguration by Irregular, an independent testing company Meta uses, inadvertently allowed one of our models access to the internet during evaluation.“ Das Modell habe dann „a security vulnerability in a third-party service“ ausgenutzt, „in a manner similar to previously reported instances with other companies“ — also so, wie es zuvor bei anderen Firmen schon berichtet wurde.
Diese Formulierung ist präziser, als sie klingt. Irregular ist eine israelische Prüffirma, die für mehrere führende Labore offensive Sicherheitstests im Stil von Capture-the-Flag-Wettbewerben durchführt — für Meta, für Anthropic und für OpenAI. Und es ist exakt dieselbe Firma und exakt dieselbe Art von Fehlkonfiguration, die schon hinter dem Anthropic-Vorfall steckte, über den wir am 1. August berichtet haben: Modelle, denen im Prompt gesagt wurde, sie liefen offline, hatten in Wahrheit Zugriff auf das offene Internet. Irregular selbst bestätigte gegenüber Reuters, es handle sich um dasselbe Problem in der Evaluierungsumgebung, das eine Woche zuvor im Zusammenhang mit Anthropic offengelegt worden war.
Wichtig für die Einordnung: Irregular betont, es habe sich weder um einen Sandbox-Ausbruch noch um eine besonders raffinierte Angriffstechnik gehandelt — „This did not involve a sandbox escape or a sophisticated cyber action. There are no current open issues.“ Das deckt sich mit dem Muster der Anthropic-Fälle, in denen die Modelle keine ausgeklügelten Exploits bauten, sondern schwache Passwörter und unauthentifizierte Endpunkte fanden. Der Name der betroffenen Organisation ist in keiner Quelle genannt — Meta, Irregular und sämtliche Berichte sprechen konsistent nur von einem nicht identifizierten Drittanbieter. Meta erfuhr von dem Vorfall zudem nicht durch eigenes Monitoring, sondern durch eine Meldung des Prüfpartners.
Die unangenehmste Pointe steckt im Kalender. Am 4. August veröffentlichte Irregular eine eigene Bewertung mit dem Titel „Assessing Meta's Muse Spark Against Offensive Security Benchmarks“. Fazit: Das Modell löse vier von sechs Expertenaufgaben, könne sie aber nicht zu vollständigen Angriffsketten verbinden, und verändere die Cyber-Bedrohungslandschaft daher nicht wesentlich. Einen Tag später wurde bekannt, dass genau dieses Modell in genau dieser Testumgebung eine echte Firma kompromittiert hatte. Nicht, weil es besonders fähig war — sondern weil ihm jemand versehentlich die Tür aufgehalten hat.
Damit sind es innerhalb von gut zwei Wochen drei große Anbieter, die reale Einbrüche aus Testläufen heraus einräumen mussten. Zu unterscheiden ist dabei zwischen zwei sehr verschiedenen Mechanismen: Die Irregular-Fälle bei Anthropic, OpenAI und Meta beruhen auf einer schlichten Fehlkonfiguration der Prüfumgebung. Der OpenAI-Fall rund um Hugging Face, über den wir zuletzt am 6. August nach dem Black-Hat-Vortrag berichtet haben, ist etwas anderes — dort fand ein internes Modell eine echte Zero-Day-Lücke in JFrog Artifactory und brach aktiv aus. Das eine ist ein Betriebsunfall, das andere eine Fähigkeitsdemonstration. Beides zusammen ergibt allerdings dasselbe Bild: Die Kontrollen um diese Tests herum sind schwächer als die Modelle, die sie testen.
Der Entwickler Simon Willison, der in seinem Blog eigens ein Schlagwort „accidental-cyberattacks“ eingeführt hat, kommentierte trocken: „So that's Anthropic, OpenAI, and Meta. Google Gemini really needs to catch up on accidentally cyberattacking other companies.“ Ernster fällt die Kritik aus der Infrastruktur-Ecke aus: Tim Hudson, Präsident der OpenSSL Corporation, spricht laut Golem von einem wiederkehrenden Muster — autonome Systeme bekommen ein Ziel, Internetzugang und zu weitreichende Rechte, und der angerichtete Schaden fällt erst im Nachhinein auf. Den genauen Wortlaut dieses Zitats konnten wir nur über eine Sekundärwiedergabe prüfen; die Stoßrichtung ist aber eindeutig.
Für Unternehmen, die selbst Agenten betreiben, ist die praktische Lehre unbequem, weil sie nichts mit Modellfähigkeiten zu tun hat. In allen Irregular-Fällen war der Schutzmechanismus eine Behauptung im Prompt — dem Modell wurde gesagt, es sei offline. Das ist keine technische Absicherung, sondern eine Bitte. Wer Agenten in einer Umgebung laufen lässt, in der sie potenziell Schaden anrichten können, muss den Netzwerkzugang auf der Ebene erzwingen, auf der er tatsächlich erzwingbar ist: Firewall, Proxy, Egress-Regeln. Bemerkenswert ist außerdem, dass in keinem der Fälle das eigene Monitoring anschlug — aufgefallen sind die Vorfälle jeweils durch Dritte oder durch Betriebsstörungen. Ein offizieller Meta-Bericht zu dem Vorfall, wie ihn Anthropic und OpenAI vorgelegt haben, existiert bislang nicht; sämtliche Angaben stammen aus Sprecher-Statements gegenüber Medien.
- Bloomberg — Meta AI Model Accessed Internet, Hacked Outside Firm in Testing
- The Washington Post — Meta says its AI model hacked another company during testing
- BleepingComputer — Meta AI model hacked a company during misconfigured cyber test
- CNN Business — An AI model from Meta also hacked another company during testing
- Simon Willison — An AI model from Meta also hacked another company during testing
- heise online — Auch KI von Meta hackte sich in eine andere Firma
- Golem.de — „Wiederkehrendes Muster“: OpenSSL-Entwickler wettert gegen KI-Hacks