Modelle · Offene Gewichte
Das beste offene Modell zum Schwachstellenfinden kommt aus Peking — und hält seine Gewichte freiwillig zwei Wochen zurück
Das chinesische Unternehmen Z.ai (früher Zhipu AI) hat am 14. August GLM-5.3 veröffentlicht. Technisch ist es kein neues Modell: Das Basismodell bleibt dasselbe wie bei GLM-5.2 — ein Mixture-of-Experts-Aufbau mit 743 Milliarden Parametern, von denen pro Token rund 40 Milliarden aktiv sind. Jeder Leistungsgewinn stammt nach Firmenangabe ausschließlich aus skaliertem Post-Training, also aus der Nachschulung des fertigen Basismodells in vielfältigeren, professionelleren Arbeitsumgebungen.
Die Zahlen zum Programmieren sind bemerkenswert: Terminal-Bench 3.0 springt von 4,6 auf 28,3 Punkte, DeepSWE v1.1 von 46,2 auf 66,9, AutomationBench liegt bei 48,2 Prozent. Sämtliche dieser Werte stammen aus Z.ais eigener Ankündigung; eine unabhängige Nachmessung liegt zum Redaktionsschluss nicht vor — was auch daran liegt, dass es noch nichts zum Nachmessen gibt. Und genau da beginnt die eigentliche Geschichte.
Interessanter als die Coding-Werte ist nämlich eine zweite Benchmark-Familie. Auf CyberGym erreicht GLM-5.3 84,5 Prozent, gegenüber 77,2 Prozent beim Vorgänger. Damit liegt es knapp vor den beiden besten geschlossenen Modellen des Vergleichsfelds, für die Z.ai 83,8 und 83,6 Prozent angibt. Welche Modelle das genau sind, geben die vorliegenden Berichte widersprüchlich wieder, weshalb wir sie hier nicht benennen. Zur Einordnung, weil die beiden Benchmarks oft verwechselt werden: CyberGym misst, ob ein Modell in offen einsehbarem Quellcode Sicherheitslücken findet und bestätigt — das ist die Arbeit eines Prüfers. ExploitBench misst, ob es diese Lücken auch ausnutzen kann — das ist die Arbeit eines Angreifers. Dort kommt GLM-5.3 auf 54,4 Prozent nach zuvor 24,4 und bleibt damit deutlich hinter dem stärksten geschlossenen Modell des Vergleichsfelds (78,0). Das Modell ist also ein Weltklasse-Finder und ein mittelmäßiger Ausnutzer.
Ungewöhnlich ist, wie Z.ai das kommentiert. In der Ankündigung heißt es, die Cyber-Fähigkeit habe sich „schneller entwickelt, als wir erwartet haben"; das Modell habe begonnen, „über mehrere Stufen der Ausnutzung hinweg zu schließen und zusammenhängende Pläne für vollständige Angriffsketten zu bilden". Das war laut Firmenangabe nicht das Trainingsziel. Ein Anbieter, der eine unbeabsichtigte Offensivfähigkeit seines eigenen Produkts öffentlich als solche benennt, ist in dieser Branche selten genug, um es festzuhalten.
Belege aus dem Feld liefert Z.ai gleich mit: Seit GLM-5.2 habe man mit den Modellen 2.436 Schwachstellen in 269 Open-Source-Projekten gefunden, davon 1.097 als kritisch oder hoch eingestuft. Namentlich genannt werden ein Use-after-free im Linux-Kernel, ein Speicherfehler in Apples WebKit-Engine und ein Fehler in der Parameterprüfung von FreeBSD; der Großteil der Funde liegt noch unter Embargo, bis die Projekte gepatcht haben. Unabhängig davon berichtete der Sicherheitsforscher Joshua Saxe, GLM-5.3 habe eine ernste Schwachstelle im KI-Editor Cursor gefunden, die vertraulich gemeldet und mit dem Cursor-Team behoben wurde. Diese Angaben sind glaubwürdig, aber nicht extern geprüft.
Der eigentliche Bruch mit der bisherigen Praxis ist der Zeitplan. Zum Start ist GLM-5.3 nur über den kostenpflichtigen GLM Coding Plan und die Entwicklungsumgebung ZCode nutzbar. API-Zugang und offene Gewichte kommen gestaffelt, etwa zwei Wochen später — Z.ai nennt als Grund ausdrücklich die noch laufende Sicherheitsauswertung und Härtung. Für ein Haus, dessen Geschäftsmodell auf sofort herunterladbaren Gewichten beruht, ist das ein Novum. Der Werbeslogan des Modells lautet dabei „Built to Code. Ready for Cyber Defense." — Verteidigung, nicht Angriff. Nur lässt sich ein Modell, das Lücken zuverlässig findet, nicht so bauen, dass es nur die richtigen Leute findet.
Damit steht die Meldung in einem regulatorischen Zusammenhang, der ihr eine unangenehme Pointe gibt. Der von Washington Anfang August finalisierte Prüfrahmen für Frontier-Modelle testet ausschließlich Cyberfähigkeiten — und nimmt ausschließlich Open-Weight-Modelle vollständig aus, wie wir am 6. August beschrieben haben. Beim Vorgänger GLM-5.2 hatte der SaferAI-Risikobericht vermerkt, dass das Modell zwar zwei bis vier Monate Rückstand auf die Spitze habe, aber kein einziges Angriffsziel verweigerte. OpenAI wiederum hat sein unveröffentlichtes Modell ASTRA wegen genau solcher Fähigkeiten ausgebremst — als geschlossener Anbieter, der die Notbremse jederzeit ziehen kann.
Nüchtern zusammengefasst: Die einzige wirksame Sicherheitsschranke vor der Veröffentlichung des derzeit stärksten offenen Schwachstellenfinders ist die freiwillige Entscheidung eines Unternehmens in Peking, zwei Wochen zu warten. Kein amerikanisches Verfahren greift hier, weil offene Modelle ausgenommen sind. Der EU-AI-Act greift bei den Pflichten für Modelle mit systemischem Risiko zwar grundsätzlich auch für offene Gewichte, ist aber kein Freigabeverfahren vor der Veröffentlichung. Wer bislang argumentiert hat, offene Gewichte seien harmlos, weil sie der Spitze hinterherlaufen, muss das für die Disziplin Schwachstellensuche in zwei Wochen neu begründen.
Für Unternehmen ist die praktische Konsequenz weniger dramatisch, aber konkret. Erstens: Wer offene Modelle betreibt, sollte davon ausgehen, dass ab Ende August ein frei herunterladbares Modell auf dem eigenen Quellcode Lücken findet, die bisher niemand gefunden hat — das gilt für die eigene Sicherheitsabteilung ebenso wie für alle anderen. Zweitens: Der sinnvolle Zeitpunkt, das defensiv zu nutzen, ist vor dem Gewichte-Release, nicht danach. Drittens: Die Zwei-Wochen-Frist ist eine Selbstverpflichtung ohne Prüfinstanz. Man sollte sie zur Kenntnis nehmen, aber nicht zur Grundlage einer Planung machen.
- Z.ai — GLM-5.3 (offizielle Ankündigung)
- heise online — Neue Version des Open-Weight-Modells: GLM 5.3 verbessert Sicherheitsfähigkeiten
- Unite.AI — Z.ai Launches GLM-5.3 With Frontier Coding and a Cyber Capability That Outgrew Its Training
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model
- the-decoder — Zhipu AI releases GLM-5.3, claims strongest open-weights coding model
- Crypto Briefing — GLM-5.3 identifies serious vulnerability in Cursor code editor