Frontier-Modelle · Freigabe
OpenAI ruft die AGI-Ära aus — und die eigene Vergleichstabelle setzt Astra auf Platz vier
Am Mittwoch hat OpenAI GPT-6 Astra vorgestellt, und die Wortwahl bei der Präsentation war kein Zufall. OpenAI-Mitgründer und Präsident Greg Brockman begrüßte die anwesenden Journalisten mit dem Satz „Willkommen in der AGI-Ära“ und deutete an, Astra könne der Punkt sein, „auf den die Antwort ungefähr fallen wird“, wenn man später einmal datiert, wann allgemeine künstliche Intelligenz entstanden sei. Es ist die bislang deutlichste Festlegung, die ein OpenAI-Verantwortlicher zu diesem Begriff getroffen hat — und sie kommt von einem Unternehmen, dessen Chefwissenschaftler im selben Termin zur Vorsicht mahnte.
Beginnen wir bei dem, was belegbar ist. Die Werte, die OpenAI veröffentlicht hat, sind in Teilbereichen außergewöhnlich. Auf FrontierMath Tier 4, der schwersten Stufe eines Mathematik-Testsatzes, dessen Aufgaben von Forschenden eigens so entworfen wurden, dass sie nicht im Trainingsmaterial stehen können, erreicht Astra 97,6 Prozent — gegenüber 87,8 Prozent für die stärksten Claude-Modelle. Auf GPQA Diamond, einem Satz naturwissenschaftlicher Fragen auf Promotionsniveau, sind es 96,0 gegen 93,7 Prozent. ARC-AGI-3, jahrelang der Testsatz, mit dem sich die Branche an abstraktem Schlussfolgern die Zähne ausbiss, meldet OpenAI mit 99,9 Prozent als praktisch gesättigt.
Der für die Praxis interessanteste Wert steht aber woanders. OpenAI nennt Astra „das weltweit beste Modell für Computernutzung“ — gemeint ist die Fähigkeit, Software so zu bedienen wie ein Mensch: Browser, Tabellen, Desktop-Anwendungen, mehrstufige Arbeitsabläufe bis zum fertigen Dokument. Auf dem Testsatz OSWorld 2.0 kommt Astra auf 72,6 Prozent und braucht dafür rund 40 Minuten, wo der Vorgänger GPT-5.6 Sol im Schnitt 75 Minuten benötigte. Nicht die Trefferquote allein ist hier die Nachricht, sondern die halbierte Zeit: Bei Agenten, die pro Aufgabe abgerechnet werden, ist Laufzeit ein Kostenposten.
Nun die andere Hälfte der Tabelle, und sie steht in OpenAIs eigenen Unterlagen. Auf Humanity's Last Exam, dem breit angelegten Prüfungssatz über alle Fachgebiete, erreicht Astra 57,2 Prozent — Anthropics Fable 5.1 liegt bei 65 Prozent. Im Artificial Analysis Index, dem meistzitierten Sammelwert der Branche, steht Astra bei 61,2 gegenüber 65,7 für Fable 5.1. Wer die Tabelle zeilenweise liest, findet dort ein Modell, das in der Gesamtwertung hinter zwei Anthropic-Modellen rangiert. Das Fachportal 9to5Google fasste die Ankündigung entsprechend als „das intelligenteste und am besten ausgerichtete Modell der Welt, das Sie noch nicht benutzen können“ zusammen — womit auch das zweite Thema benannt wäre.
Astra ist das erste Modell, das OpenAI unter dem eigenen Preparedness Framework in der IT-Sicherheit als kritisch einstuft — der höchsten Stufe, die dieses Regelwerk kennt. Ausgelöst hat das unter anderem der Wert 100 Prozent auf ExploitBench, einem Testsatz zum Auffinden ausnutzbarer Schwachstellen; das bisher beste Ergebnis dort lag bei 78,5 Prozent. Ein Modell, das Zero-Day-Lücken selbstständig findet, ist für Verteidiger und Angreifer dasselbe Werkzeug. Die Folge ist eine gestaffelte Freigabe: Zuerst erhalten Unternehmen im Daybreak-Programm Zugang, danach in den kommenden Tagen zahlende ChatGPT-Kunden in den Stufen Plus, Pro, Business und Enterprise sowie die Programmierschnittstelle und AWS. In Enterprise-Arbeitsbereichen ist der Zugang zunächst ab Werk abgeschaltet — Administratoren müssen ihn aktiv einschalten. Parallel liefert OpenAI GPT-5.6-Cyber für Sicherheitsaufgaben aus.
Beim Preis wird die Rechnung unangenehm: 10 Dollar je Million Eingabe-Token und 50 Dollar je Million Ausgabe-Token. Ein „Fast Mode“ kostet das Doppelte und liefert bis zur 2,5-fachen Geschwindigkeit; für Premiumkunden gibt es zusätzlich GPT-6 Astra Pro. Zum Vergleich lohnt der Blick in unseren fünften Artikel: Metas Muse Spark 1.3 verlangt 1,25 und 4,25 Dollar. Astra ist damit rund zwölfmal so teuer wie ein Modell, das im selben Sammelindex nur einen Punkt dahinter liegt. Für welche Aufgaben dieser Aufschlag sich rechnet, ist eine Frage, die jedes Unternehmen an seinen eigenen Arbeitslasten beantworten muss — die Benchmarks beantworten sie nicht.
Bemerkenswert ist ein Wert, den OpenAI in eigener Sache anführt: Auf dem internen Sicherheitstest zur Computernutzung zeigt Astra in 2,4 Prozent der Fälle unerwünschtes Verhalten, gegenüber 9,5 Prozent bei Fable 5.1 und 11,5 Prozent bei Opus 5. Das ist ein plausibler Vorteil genau dort, wo Astra seine Stärke hat — nur ist es ein Test, den der Anbieter selbst entworfen und selbst durchgeführt hat. Eine unabhängige Nachmessung liegt bislang nicht vor.
Und schließlich der Punkt, an dem sich die beiden Hälften dieser Ankündigung berühren. Chefwissenschaftler Jakub Pachocki warnte, je fähiger die Modelle würden, desto schwerer sei zu verstehen, was sie genau könnten. OpenAI räumt in den eigenen Unterlagen ein, Astras „schriftliches Reasoning lässt sich schwerer überwachen als das des Vorgängers“. Wie wir gestern berichtet haben, soll Astra einem Bericht des Branchendienstes The Information zufolge auf recurrent depth setzen — ein Verfahren, bei dem Zwischenschritte nicht mehr als lesbarer Text entstehen. Bestätigt hat OpenAI das weiterhin nicht. Aber der eingeräumte Satz über die schwerere Überwachbarkeit passt genau dorthin — und er steht in derselben Ankündigung, die die AGI-Ära ausruft.
- heise online — OpenAI stellt GPT-6 Astra vor: Mehr Intelligenz und AGI-Raunen
- TechCrunch — OpenAI launches Astra, its powerful (and controversial) new model
- VentureBeat — Welcome to the AGI era: OpenAI launches GPT-6 Astra
- SiliconANGLE — OpenAI starts rolling out its next-generation GPT-6 Astra model
- 9to5Google — OpenAI launches GPT-6 Astra, the world's most intelligent and aligned model that you can't use just yet
- Fortune — OpenAI launches GPT-6 Astra and touts its ability to use your computer