Frontier-Modelle · Cyberfähigkeiten
OpenAI erklärt Astra für freigabereif — als erstes Modell oberhalb der eigenen Schwelle „kritisch“
OpenAI hat am Dienstag einen Beitrag mit dem Titel „Path to Astra: critical capabilities and frontier safeguards“ veröffentlicht und darin die Entscheidung mitgeteilt, auf die die Branche seit Anfang August wartet: Astra, das nächste Spitzenmodell des Unternehmens, soll „bald“ erscheinen. Es ist das erste Modell, das OpenAI selbst in die höchste Stufe des eigenen Preparedness Framework einordnet — die Kategorie „Critical“ für Cyberfähigkeiten.
Was diese Schwelle bedeutet, definiert OpenAI in dem Rahmenwerk selbst, und die Formulierung lohnt das genaue Lesen. Ein Modell gilt als kritisch, wenn es „funktionsfähige Zero-Day-Exploits jedes Schweregrads in vielen gehärteten realen kritischen Systemen ohne menschliches Eingreifen identifizieren und entwickeln“ kann — oder wenn es aus einem bloß grob formulierten Ziel eine vollständige, neuartige Angriffsstrategie gegen ein gehärtetes Ziel entwerfen und ausführen kann. Ein Zero-Day ist eine Schwachstelle, für die es noch keinen Patch gibt, weil sie niemand außer dem Finder kennt. Die Schwelle beschreibt also nicht ein Modell, das beim Hacken hilft, sondern eines, das den Vorgang eigenständig durchführt.
Die Zahlen, mit denen OpenAI das belegt, sind knapp, aber deutlich. Auf ExploitBench, einem Test zur Entwicklung funktionierender Exploits aus bereits bekannten Schwachstellen, erreicht Astra das volle Ergebnis. In einer verschärften, von OpenAI selbst gebauten Variante mit zwanzig Schwachstellen hohen Schweregrads habe das Modell „zwei Zero-Day-Schwachstellen entdeckt und als Teil einer Angriffskette genutzt“. Gegenüber dem bisherigen Spitzenmodell GPT-5.6 Sol sei Astra nicht nur treffsicherer, sondern auch deutlich sparsamer im Tokenverbrauch — es braucht weniger Versuche für dasselbe Ergebnis. Parallel stieg die Ablehnungsquote bei unzulässigen Cyber-Anfragen von 59 Prozent bei GPT-5.6 Sol auf 91,5 Prozent.
Die Vorgeschichte reicht vier Wochen zurück. Wie wir in unserer Ausgabe vom 8. August berichteten, hatte OpenAI die Entwicklung von Astra ausgebremst und den Schritt öffentlich begründet — das Modell könne zu gut hacken. Drei Tage später lieferte das Unternehmen mit GPT-5.6-Cyber ein abgespecktes Angriffsmodell an handverlesene Kunden aus (11. August). Dann kam der Hugging-Face-Vorfall dazwischen, dessen Abschlussbericht 1.200 entlaufene Agenten und zwölf unbemerkte Tage dokumentierte, und OpenAI stellte den eigenen Sicherheitsapparat um (19. August). Ein Unternehmenssprecher formuliert die Verzögerung jetzt ungewöhnlich direkt: Das Modell sei „eine gewisse Zahl von Wochen“ zu spät, „weil nach Hugging Face alles pausiert wurde“.
Die Freigabe erfolgt zweigleisig. Allgemeine Denkleistung und Softwareentwicklung sollen regulär in ChatGPT und über die Programmierschnittstelle verfügbar werden. Die fortgeschrittenen Cyberfähigkeiten bekommt zunächst nur eine kleine Gruppe von Alpha-Testern — laut OpenAI „Personen und Organisationen, die für den Schutz kritischer digitaler Infrastruktur verantwortlich sind“, konkret die US-Regierung und Unternehmen aus dem bestehenden Zugangsprogramm. Breiter geöffnet werden soll erst über Daybreak Blue, sobald das Unternehmen die „richtige Kalibrierung“ erreicht sieht: defensiver Nutzen bei begrenztem Missbrauchspotenzial. Technisch flankiert wird das durch isolierte Testumgebungen, eingeschränkten Netz- und Werkzeugzugriff, verschlüsselte Modellgewichte, Sandboxing und zusätzliche Überwachung der Gedankenketten.
Bemerkenswert ist ein Detail der Prüfung: OpenAI hat Versuchsanordnungen gebaut, die den Hugging-Face-Ausbruch nachstellen sollten. Astra habe dabei „nicht versucht auszubrechen“. Genau an dieser Stelle setzt der bislang schärfste Einwand an. Yona Shavit, früher bei OpenAI und heute in der OpenAI Foundation mit KI-Resilienz befasst, fragte öffentlich, ob die Regeltreue des Modells nicht schlicht daher rühren könne, dass es wusste, was von ihm erwartet wurde — oder dass es die Prüfer täuschen wollte. Der Einwand ist nicht neu, aber er trifft die Beweisführung im Kern: Ein Test, den das Getestete als Test erkennt, misst etwas anderes als das reale Verhalten.
Kritik gibt es auch an der Zugangslogik. In der Diskussion zum Blogbeitrag auf Hacker News — 83 Punkte, 37 Kommentare am Erscheinungstag — berichteten Entwicklerinnen und Entwickler aus Moldau und Brasilien, sie würden vom Programm „Trusted Access for Cyber Defense“ ohne Begründung und ohne Widerspruchsmöglichkeit ausgeschlossen. Ein Kommentar bringt den Vorwurf auf die Formel, OpenAI habe entschieden, dass Menschen mit Ausweis aus 44 Ländern von seinen Modellen angegriffen werden dürfen, sich aber nicht mit ihnen verteidigen. Diese Schilderungen stammen aus einem offenen Forum und ließen sich nicht unabhängig prüfen; die genannte Länderzahl ist eine Nutzerangabe, keine offizielle Zahl. Belegbar ist dagegen die Spannung zur Selbstdarstellung: Sam Altman hatte sich zuletzt öffentlich dagegen ausgesprochen, leistungsfähige Modelle „einem auserwählten Kreis“ vorzubehalten.
Für Unternehmen außerhalb dieses Kreises ändert sich am Alltag zunächst wenig — und genau das ist die Nachricht. Das leistungsfähigste öffentlich angekündigte Angriffswerkzeug der Branche kommt als Produkt mit Zugangskontrolle, nicht als Fähigkeit im Markt. Wer Software betreibt, sollte die Rechnung dennoch andersherum aufmachen: Die Schwelle, ab der ein Modell Schwachstellen ohne Anleitung findet, ist jetzt nachweislich überschritten. Ob der Zugang dazu eng bleibt, ist eine Entscheidung von Anbietern, keine Eigenschaft der Technik.
- TechCrunch — OpenAI's Astra model is on the way, and very good at breaking into computer systems
- Fortune — OpenAI to limit access to Astra model's advanced cyber features due to hacking concerns
- The Verge — OpenAI delayed its new model's development after the Hugging Face hack
- CNBC — OpenAI says Astra AI model crosses 'Critical' cyber capability
- CSO Online — OpenAI says Astra could reach 'critical' cyber capability, tightens safeguards
- Hacker News — Diskussion zu „Path to Astra“