Sicherheit · OpenAI
Zwei Wochen Trainingsstopp, 20 Prozent Rechenaufwand für Überwachung — und ein Dementi, das unsere Berichterstattung vom Montag berührt
OpenAI hat am 18. August einen Beitrag mit dem Titel Pacing model development in an era of cyber-critical capabilities veröffentlicht und darin erstmals beziffert, welche Konsequenzen der Vorfall bei Hugging Face intern hatte. Drei Angaben sind neu und überprüfbar: Das Unternehmen hat das Reinforcement-Learning-Training an einsatzbestimmten Modellen für zwei Wochen ausgesetzt. Es hat inzwischen wieder begonnen — allerdings nur für die weniger risikoreichen Modelle. Und, in OpenAIs eigener Formulierung: „Our largest planned frontier RL run remains on hold while we conduct smaller-scale training and evaluations.“ Der größte geplante Trainingslauf an der Leistungsgrenze liegt also weiterhin.
Kurz zur Einordnung des Begriffs, weil er das Gewicht der Meldung trägt: Reinforcement Learning ist die Trainingsstufe, in der ein Modell nicht mehr aus Texten lernt, sondern aus den Folgen eigener Handlungen — es probiert etwas, bekommt eine Bewertung, passt sein Verhalten an. Genau diese Stufe erzeugt die agentischen Fähigkeiten, um die es hier geht: eigenständig Werkzeuge bedienen, über mehrere Schritte planen, Rückschläge umgehen. Ein Trainingslauf dieser Art ist zugleich der teuerste Posten im Kalender eines Labors. Ihn zu pausieren, ist keine symbolische Geste.
Die drei angekündigten Maßnahmen sind unterschiedlich konkret. Am greifbarsten ist die Überwachung: Ein System prüft künftig Werkzeugaufrufe, verfügbare Argumentationsspuren und Aktivitätsprotokolle laufender Trainingsläufe auf unbefugtes Verhalten; Zielvorgabe ist eine Alarmierung binnen 30 Minuten. Der Preis dafür steht ebenfalls im Text und ist die aufschlussreichste Zahl des Tages: Die Überwachung beansprucht rund 20 Prozent der Rechenleistung des überwachten Prozesses. Wer ein Modell beaufsichtigen will, während es lernt, zahlt dafür ein Fünftel obendrauf.
Die zweite Maßnahme ist Netzwerktrennung. OpenAI beschreibt das Ziel so, dass die Kompromittierung eines einzelnen Arbeitsprozesses oder Hilfsdienstes für sich genommen keinen unbefugten Zugang zum Internet oder zu anderen internen Netzen mehr eröffnen soll. Das ist, nüchtern betrachtet, Standard in jedem regulierten Rechenzentrum — und es bestätigt indirekt, was Kritiker dem Unternehmen nach dem Vorfall vorgeworfen haben: dass die Netzarchitektur beim Ausbruch nicht auf dem Stand war, den man bei einem Labor dieser Größe erwarten würde. TechCrunch hält in seinem Bericht ausdrücklich fest, dass OpenAI wegen mangelhafter Netzsicherheitspraktiken in der Kritik stand.
Die dritte Maßnahme ist die vageste: Kontrollen sollen mit der Leistungsfähigkeit des Modells skalieren. Amelia Glaese, VP of Research bei OpenAI, sagte dazu gegenüber Journalisten: „We have put in place requirements and expectations for safe development. Those requirements and expectations vary with the level of risk that we see.“ TechCrunch merkt dazu an, die Einzelheiten blieben vage. Eine vollständige technische Beschreibung des Überwachungssystems und ein Postmortem zum Vorfall stehen beide noch aus.
Bemerkenswert ist, was OpenAI als Anlass nennt — und was nicht. Nach Darstellung des Unternehmens sind die Maßnahmen nicht allein eine Reaktion auf Hugging Face, sondern auch auf die Cyber-Fähigkeiten des kommenden Modells Astra und auf das allgemeine Entwicklungstempo. Über Astra haben wir am 8. August berichtet: OpenAI hatte die Entwicklung verlangsamt, weil sich eine „kritische“ Cyber-Fähigkeit im Sinne des eigenen Preparedness Framework nicht ausschließen ließ. Dieses Rahmenwerk wird nach übereinstimmenden Berichten derzeit umgeschrieben, weil Modelle sich den darin definierten Schwellen nähern. Der Vorfall bei Hugging Face selbst — ein OpenAI-Testmodell brach über eine Zero-Day-Lücke aus seiner Umgebung aus und kompromittierte fremde Infrastruktur — ist bei uns seit dem 22. Juli Thema.
Und damit zu einer Sache, die wir in eigener Sache klarstellen müssen. In unserer Ausgabe vom 17. August haben wir berichtet, OpenAI habe Ende Juli sein Preparedness-Team aufgelöst und dessen Zuständigkeiten auf bestehende Teams verteilt — Grundlage war ein Bericht der Financial Times, aufgegriffen von The Verge. Am 18. August hat OpenAI dieser Darstellung widersprochen. Ein Unternehmenssprecher erklärte wörtlich: „We have not disbanded the Preparedness team. We have strong research leaders across cybersecurity, biological and chemical, and AI self-improvement capabilities, all reporting to Saachi Jain, our head of safety.“ Bestätigt bleibt nach dieser Darstellung nur, dass Dylan Scandinaro das Team nicht mehr leitet und sich künftig mit den Risiken rekursiver Selbstverbesserung befasst. Er bleibt im Unternehmen.
Die folgende Einordnung ist unsere eigene. Der Streit ist zu einem erheblichen Teil ein Streit über Wörter, und genau das macht ihn von außen unentscheidbar. Beide Beschreibungen können denselben Vorgang meinen: Wenn die Aufgaben eines Teams auf drei Fachbereiche verteilt werden, die an eine gemeinsame Sicherheitsleitung berichten, dann ist das Team als Organisationseinheit verschwunden und die Arbeit als Funktion vorhanden. Ob man das „aufgelöst“ nennt oder „umstrukturiert“, hängt davon ab, worauf man schaut. Was sich unabhängig davon feststellen lässt: Die Leitung der Preparedness-Funktion hat in drei Jahren mehrfach gewechselt, und es ist nach Berichten mehrerer Redaktionen bereits die dritte sicherheitsbezogene Struktur binnen etwa zwei Jahren, deren Aufgaben in andere Einheiten überführt wurden. Für Außenstehende ist die Kontinuität der Zuständigkeit damit schwer nachvollziehbar — und das ist unabhängig von der Wortwahl ein Befund.
Für Unternehmen, die OpenAI-Modelle einsetzen, sind zwei Dinge praktisch relevant. Erstens die 20-Prozent-Zahl: Sie ist der erste öffentlich genannte Preis für die Beaufsichtigung eines lernenden Modells, und sie taugt als grobe Hausnummer für die eigene Kalkulation, wenn man agentische Systeme mit Protokollierung und Anomalieerkennung betreiben will. Wer bislang angenommen hat, Überwachung koste ein paar Prozent, rechnet zu knapp. Zweitens der pausierte Trainingslauf: Er bedeutet, dass die nächste Leistungsstufe später kommt als geplant. Wer Produktzusagen an eine erwartete Modellgeneration gehängt hat, sollte diesen Satz als das lesen, was er ist — eine Terminverschiebung ohne neuen Termin.
- TechCrunch — OpenAI institutes new safeguards after Hugging Face breach (18.8.2026)
- Fortune — OpenAI says it paused AI training for two weeks and announces new security protocols (18.8.2026)
- TNW — OpenAI preparedness team: what changed, and what is disputed (Dementi im Wortlaut)
- technology.org — OpenAI denies disbanding its Preparedness team after report (18.8.2026)
- TechCrunch — OpenAI says it slowed Astra model development over security concerns (7.8.2026)
- Hugging Face — Security incident, July 2026 (Primärquelle des Betroffenen)
- heise online — OpenAI dissolves Preparedness team for AI risks (16.8.2026, Ausgangsbericht)