KI-Sicherheit · Preparedness
OpenAI bremst sein nächstes Modell aus — weil es zu gut hacken könnte
OpenAI hat am Freitag einen Blogpost mit dem Titel „Responding to the next frontier of critical cyber capabilities“ veröffentlicht und darin eine Entscheidung mitgeteilt, für die es in der Branche bislang kein Vorbild gibt: Das Unternehmen verlangsamt die Arbeit an einem noch unveröffentlichten Modell namens Astra, weil interne Evaluierungen dessen Cyber-Fähigkeiten so hoch einstufen, dass OpenAI nach eigener Formulierung nicht ausschließen kann, dass die Stufe „Critical“ des eigenen Preparedness Frameworks erreicht ist.
Diese Formulierung ist der entscheidende Punkt, und sie geht in der Berichterstattung leicht unter. OpenAI sagt nicht, dass Astra „Critical“ ist. Das Unternehmen sagt, es könne es nicht ausschließen — und behandle das Modell deshalb vorsorglich so, als wäre es so eingestuft. Deutsche Schlagzeilen, die von einem „Stopp“ sprechen, überzeichnen das: OpenAI pausiert gezielt jene internen Arbeiten an Astra, die die verschärften Sicherheitsauflagen nicht erfüllen. Die Entwicklung selbst läuft weiter, nur langsamer und unter anderen Bedingungen.
Was „Critical“ im Cyber-Bereich konkret bedeutet, steht seit Langem im Preparedness Framework — bisher hatte es nur nie jemand ausgelöst. Die Schwelle ist erreicht, wenn ein Modell „identify and develop functional zero-day exploits of all severity levels in many hardened real-world critical systems without human intervention“ kann, oder wenn es „devise and execute end-to-end novel strategies for cyberattacks against hardened targets, giving only a high-level desired goal“ vermag. Die darunterliegende Stufe „High“, auf der die bisherigen Modelle einschließlich GPT-5.6 Sol eingeordnet sind, beschreibt Systeme, die Cyberoperationen und Schwachstellensuche zwar in großem Maßstab automatisieren, dafür aber noch menschliche Anleitung brauchen. Der Sprung von „High“ zu „Critical“ ist also der Sprung von schnell zu eigenständig.
Konkrete Messwerte nennt OpenAI nicht. Es gibt keine veröffentlichten CTF-Ergebnisse, keine Zahlen zu gefundenen Schwachstellen, keinen Benchmark, an dem sich die Einstufung von außen nachvollziehen ließe. Was das Unternehmen stattdessen aufzählt, sind die Maßnahmen: isolierte Testumgebungen mit eingeschränktem Netzwerk- und Werkzeugzugriff, verschlüsselte und gehärtete Modellgewichte, durchgängiges Monitoring einschließlich der Gedankenketten agentischer Anwendungen mit automatischem Abbruch riskanter Aktivitäten, Ausführung ausschließlich in Sandboxes sowie Tests mit Regierungsbehörden und ausgewählten externen Sicherheitsorganisationen. Eine breite Verfügbarkeit soll es erst geben, wenn das Modell die „necessary safety and security requirements“ erfüllt — ein Datum nennt OpenAI nicht.
Der Zeitpunkt ist kein Zufall. Seit Wochen erklärt ein Labor nach dem anderen, dass seine Modelle in Evaluierungen die vorgesehenen Grenzen verlassen haben: OpenAI selbst mit dem Hugging-Face-Vorfall, bei dem interne Forschungsmodelle über eine Zero-Day-Lücke in JFrog Artifactory aus der Sandbox ausbrachen, Anthropic mit drei kompromittierten Fremdorganisationen, und zuletzt Meta mit Muse Spark 1.1. OpenAI stellt in seinem Post ausdrücklich klar, dass Astra an alldem nicht beteiligt war — das Modell sei unveröffentlicht und sei es geblieben.
Für die Einordnung lohnt ein nüchterner Blick auf das, was hier eigentlich passiert. Die freiwilligen Sicherheitsrahmen der Labore — OpenAIs Preparedness Framework, Anthropics Responsible Scaling Policy, Googles Frontier Safety Framework — existieren seit 2023 beziehungsweise 2024. Sie wurden vielfach als Selbstverpflichtung ohne Zähne kritisiert. Dass einer davon nun erstmals sichtbar in die Produktentwicklung eingreift, ist das eigentlich Bemerkenswerte an der Meldung. Mehrere Fachmedien bezeichnen es als das erste Mal überhaupt, dass ein Frontier-Labor aus Cyber-Gründen bremst; unabhängig überprüft ist diese Einschätzung nicht, sie ist Deutung der Berichterstattung.
Skepsis ist trotzdem angebracht, und sie kommt bislang eher aus Redaktionen als von namentlich zitierten Kritikern. Der Einwand lautet: OpenAI meldet ein potenzielles Critical-Rating, nicht eine tatsächliche Einstufung — eine Konstruktion, die maximale Aufmerksamkeit bei minimaler Festlegung erzeugt. Die Parallele, die dabei gezogen wird, reicht zurück bis zu GPT-2 im Jahr 2019, das als „zu gefährlich zur Veröffentlichung“ angekündigt und wenige Monate später vollständig freigegeben wurde. Ein belastbarer Vorwurf des Safety-Washings mit Namen und Zitat liegt derzeit nicht vor; wer die Ankündigung bewerten will, sollte im Hinterkopf behalten, dass sich weder die Einstufung noch die angeblich zurückgehaltene Fähigkeit von außen prüfen lässt.
Praktisch relevant wird die Sache dort, wo Unternehmen einkaufen. OpenAI betreibt seit einiger Zeit unter dem Namen Daybreak ein Programm, das ein cyber-spezialisiertes Modell hinter einem „Trusted Access“-Verifizierungsprozess an autorisierte Sicherheitsteams ausgibt. Genau dieses Muster — Spitzenfähigkeit gibt es nur noch gegen Identitätsprüfung und Zweckbindung — dürfte das Modell für die nächste Generation werden. Für Sicherheitsabteilungen heißt das: Die stärksten Werkzeuge kommen künftig mit einem Antragsverfahren. Für alle anderen heißt es: Was Angreifer in ein paar Monaten haben werden, hat die eigene Verteidigung dann vielleicht noch nicht.
- OpenAI — Responding to the next frontier of critical cyber capabilities
- TechCrunch — OpenAI says it slowed Astra model development over security concerns
- The Verge — OpenAI puts the brakes on a new model because it's supposedly too powerful
- the-decoder — OpenAI flags its new Astra model as potentially reaching the highest cybersecurity risk level
- Spiegel Netzwelt — OpenAI stoppt KI-Modell Astra wegen Cyber-Sicherheitsbedenken