KI-Sicherheit · Anthropic
„Crunch time“: Ein Anthropic-Forscher kündigt, und der Alignment-Chef desselben Hauses beziffert das Auslöschungsrisiko auf über zehn Prozent
Am Dienstag hat der Anthropic-Forscher Jacob Coxon seinen Rücktritt erklärt. Der Text, den er dazu auf X veröffentlichte, hatte zum Zeitpunkt des WIRED-Interviews am Mittwochabend über hundert Millionen Aufrufe. Coxon arbeitete am Pretraining, also an der Grundstufe des Modelltrainings, zuvor bei OpenAI. Er wechselt nicht zu einem Wettbewerber — er verlässt das Feld.
Der Satz, der die Runde machte, lautet: „They are racing straight to self-improving superintelligence and gambling with our lives.“ Man rase geradewegs auf sich selbst verbessernde Superintelligenz zu und spiele dabei mit unser aller Leben. Solche Sätze gab es schon einige. Was diesen Fall unterscheidet, ist die Reaktion aus dem eigenen Haus.
Hier ist eine Klarstellung nötig, weil ein Teil der deutschen Berichterstattung sie unterschlägt: Die vielzitierte Zahl von über zehn Prozent stammt nicht von Coxon. Sie stammt von Evan Hubinger, dem Leiter der Alignment-Forschung bei Anthropic, der auf X schrieb, er halte eine Wahrscheinlichkeit von über zehn Prozent dafür für gegeben, dass KI innerhalb des kommenden Jahrzehnts alle Menschen töte. Mehrere deutschsprachige Meldungen schreiben diese Aussage Coxon zu — das ist falsch. Und es ist ausdrücklich eine persönliche Einzelschätzung, keine Umfrage und kein Branchenkonsens, auch wenn aktive und ehemalige Forscher von OpenAI und Anthropic den Beitrag teilten und ihn als verbreitete Stimmung bezeichneten.
Coxons eigene Aussage ist eine andere, und sie ist auf ihre Weise beunruhigender, weil sie überprüfbar ist. Er berichtet über die Sprache seiner Kollegen: „These are actually just literal quotes from my colleagues at Anthropic. They'll say things like ‚endgame‘ or ‚crunch time‘.“ Und weiter: „The consensus is that the next year or two is crunch time for humanity.“ Das ist keine Prognose über die Welt, sondern eine Beschreibung dessen, wie in einem der beiden führenden Labore über die eigene Arbeit gesprochen wird.
Auffällig ist, dass Coxon Anthropic ausdrücklich verteidigt. Er nennt das Unternehmen „far and away the most responsible player in the space“ und beschreibt den Unterschied zu OpenAI, wo er ebenfalls gearbeitet hat, als „Tag und Nacht“. Anthropic-Führungskräfte machten konkrete Vorhersagen und legten Strategie intern offen; bei OpenAI bekomme man solche Bilder nicht. Der Vergleich, den er zieht, ist der, den WIRED in den Vorspann gehoben hat: Bei Anthropic behandelten die Leute die Sache „like a serious mini Manhattan Project“ — mit dem entscheidenden Unterschied, dass ein Privatunternehmen kein staatliches Mandat hat. Auf die Frage, ob die Welt Anthropic dieses Mini-Manhattan-Projekt anvertrauen solle, antwortet er: „I think no private company should.“
Sein Argument ist strukturell und deshalb für Entscheider interessanter als jede Untergangsprognose. Anthropic schneide heute keine Ecken ab — „No, not yet.“ Aber die Logik des Wettlaufs erzwinge es künftig. Deshalb betteten die Verantwortlichen geradezu um Regulierung: nicht aus Altruismus, sondern weil sie dem Wettbewerb, in dem sie stehen, selbst nicht trauen könnten.
Was er konkret fordert, ist kein Moratorium. Der erste Schritt sei eine Verständigung zwischen OpenAI und Anthropic als den beiden führenden westlichen Laboren, im nächsten Jahr nicht unmittelbar in rekursive Selbstverbesserung einzusteigen — also nicht damit zu beginnen, KI-Systeme im großen Stil von KI-Systemen bauen zu lassen. Ein Pause-Ansatz greife zu kurz: „The problem with the pause is you've got China.“ Was man am Ende brauche, sei ein internationales Abkommen — „international pacing“ — samt der Kenntnis darüber, wo weltweit welche Rechenleistung steht. Sein Vergleich: „We need to know who has which computers in the same way that we need to know who has which nuclear materials.“ Er verweist auf eine CERN-ähnliche Institution als denkbares Vorbild.
Der bemerkenswerteste Teil dieser Geschichte ist die Antwort des Unternehmens. Anthropic wies die Kritik nicht zurück. Ein Sprecher sagte WIRED, man sei immer transparent gewesen, dass KI enorme Vorteile und beispiellose Risiken bringe — und fügte hinzu: „This work is also why we believe the world would benefit from the industry adopting a lawful, verifiable way to work together to pace how we release powerful models.“ Am Tag darauf schrieb Anthropic in seinem Bericht zu den eigenen Sicherheitsvorfällen, man unterstütze „a coordinated, verifiable approach to pacing frontier AI development“ (siehe Artikel 2). Das Unternehmen fordert also öffentlich dasselbe wie der Mann, der aus Sorge gekündigt hat. Der Streit dreht sich nicht um das Ziel, sondern darum, ob man in der Zwischenzeit weiterbauen darf. OpenAI ließ eine Anfrage von WIRED unbeantwortet.
Coxon reiht sich in eine Serie ein: Im Februar kündigte Mrinank Sharma, Leiter des Safeguards-Research-Teams bei Anthropic, mit einem Abschiedsbrief. Aus der Reihe hebt den aktuellen Fall der Zeitpunkt — Anthropic bereitet den womöglich größten Börsengang der Geschichte vor (siehe unsere Ausgabe vom 8. September), und die Branche arbeitet seit Wochen die Vorfälle mit ausgebrochenen Agenten auf. Gefragt, warum er trotz allem so lange geblieben sei, nennt Coxon den Fortschritt: Es sei keine Übertreibung, dass man Krebs heilen könne — und verweist auf den Navier-Stokes-Erfolg, über den wir gestern berichtet haben.
- WIRED — The AI Researcher Who Just Quit Anthropic Says It's ‚Crunch Time for Humanity' (Interview, Maxwell Zeff)
- TechCrunch — ‚Gambling with our lives': Anthropic researcher quits, warns against self-improving AI
- Common Dreams — Anthropic Researcher Quits, Citing Internal Fears That AI ‚Could Kill Us All' This Decade
- heise online — Anthropic-Forscher kündigt mit dramatischem Text: Branche erwarte „Auslöschung“
- DER SPIEGEL — Anthropic-Forscher tritt wegen KI-Bedenken zurück