Die Welle, die nicht kam
Als Anthropic am 7. April 2026 das Project Glasswing vorstellte, war die Reaktion in der Sicherheitsbranche eine Mischung aus Faszination und Alarm. Ein unveröffentlichtes Modell namens Claude Mythos Preview sollte selbstständig kritische Software durchsuchen: Code lesen, Eingaben durchprobieren, über Speicherlayouts nachdenken und für gefundene Lücken einen funktionierenden Nachweis produzieren. Die Partnerliste las sich wie ein Branchenverzeichnis — AWS, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorganChase, die Linux Foundation, Microsoft, NVIDIA und Palo Alto Networks. Anthropic selbst formulierte den offensichtlichen Einwand mit ungewöhnlicher Klarheit: Kein Unternehmen, das eigene eingeschlossen, habe bislang Schutzmechanismen entwickelt, die zuverlässig genug wären, um den böswilligen Einsatz von Modellen dieser Leistungsklasse zu verhindern.
Die naheliegende Befürchtung lautete: Wenn eine Maschine Schwachstellen im Industriemaßstab findet, dann finden Angreifer sie auch — und die Zeit zwischen Entdeckung und Ausnutzung schrumpft gegen null.
Vier Monate später gibt es dazu belastbare Zahlen, und sie sagen etwas anderes. Der Sicherheitsdatenanbieter VulnCheck hat für seinen Halbjahresbericht State of Exploitation 1H-2026, veröffentlicht am 29. Juli, alle Schwachstellen ausgewertet, die einer KI-gestützten Entdeckung zugeschrieben werden — aus Project Glasswing und der Berkeley Vulnerability Research Initiative. Von 1.061 solchen Schwachstellen wurden 14 nachweislich ausgenutzt. Das sind 1,3 Prozent — und damit exakt die Quote, die VulnCheck auch über den gesamten Schwachstellenbestand hinweg misst. KI-gefundene Lücken werden also weder häufiger noch seltener angegriffen als konventionell gefundene. Der Forscher Patrick Garrity zieht daraus den Schluss, die Daten sprächen eher dafür, dass Spitzenmodelle den Verteidigern einen Vorteil verschaffen als den Angreifern.
Was Glasswing tatsächlich produziert hat
Der Blick auf Glasswing im Einzelnen ist noch aufschlussreicher — und ernüchternder, als die Ankündigung erwarten ließ. Anthropic hat nach eigenen Angaben über 1.000 Open-Source-Projekte gescannt und dabei 23.019 Auffälligkeiten gemeldet, von denen 6.202 als hoch oder kritisch eingestuft wurden. Allein in einem einzigen Monat kamen die beteiligten Partner auf mehr als 10.000 Funde dieser Schweregrade.
Von diesen 23.000 Funden haben es nach VulnCheck-Zählung 126 zu einer veröffentlichten CVE-Nummer gebracht. Eine einzige gilt als in freier Wildbahn ausgenutzt.
Diese Zahlenreihe ist der Kern der Geschichte, und sie lässt sich in zwei Richtungen lesen. Die wohlwollende Lesart: Die meisten Funde waren echt, aber unbedeutend — Lücken in selten genutzten Codepfaden, theoretisch ausnutzbar, praktisch uninteressant. Die skeptische Lesart: Ein erheblicher Teil war schlicht nicht belastbar genug, um den Weg durch eine Verifikation zu überstehen. Beide Lesarten führen zum selben betriebswirtschaftlichen Befund. Ein Fund ist kein Ergebnis. Ein Ergebnis ist ein Fund, den jemand geprüft, eingeordnet, gemeldet und behoben hat — und genau dieser Teil der Kette ist nicht mitskaliert.
Anthropic benennt das selbst: Die zentrale Schwierigkeit habe sich vom Finden zum Verifizieren, Offenlegen und Patchen verlagert. Für einen von Mythos gefundenen Fehler hoher oder kritischer Schwere vergehen im Durchschnitt zwei Wochen bis zum Patch. Zwei Wochen pro Fund, bei 6.202 hochkritischen Funden — das ist keine Kapazitätsfrage mehr, das ist eine Größenordnungsfrage.
Die Institution, die aufgegeben hat
Der entscheidende Engpass liegt an einer Stelle, die in der öffentlichen Debatte kaum vorkommt: bei der Bewertung.
Damit eine gemeldete Schwachstelle für Unternehmen brauchbar wird, braucht sie mehr als eine Nummer. Sie braucht eine Einordnung: Wie schwer wiegt sie? Welche Produkte und Versionen sind betroffen? Wie lässt sie sich ausnutzen? Diese Anreicherung leistete jahrzehntelang die National Vulnerability Database (NVD) des US-Normeninstituts NIST — faktisch die Referenzdatenbank der ganzen Branche, auf der Schwachstellenscanner, Ticketsysteme und Compliance-Werkzeuge weltweit aufsetzen.
Diese Referenz gibt es in ihrer bisherigen Form nicht mehr. Am 15. April 2026 hat NIST die Arbeitsweise der NVD grundlegend umgestellt, ausdrücklich wegen des beispiellosen Anstiegs der CVE-Zahlen. Die Einreichungen sind zwischen 2020 und 2025 um 263 Prozent gewachsen, für 2026 werden mehr als 60.000 Offenlegungen erwartet, der Rückstand unbearbeiteter Einträge liegt bei über 27.000. Die Konsequenz: NIST reichert nur noch CVEs an, die im KEV-Katalog der US-Cybersicherheitsbehörde CISA stehen, Bundessoftware betreffen oder nach der Executive Order 14028 als kritisch gelten. Branchenschätzungen zufolge deckt das künftig 15 bis 20 Prozent des Volumens ab. Rund 29.000 Altfälle mit Veröffentlichungsdatum vor dem 1. März 2026 sind als Not Scheduled eingestuft — sie werden also nicht mehr bearbeitet.
Für Unternehmen heißt das im Klartext: Für vier von fünf neuen Schwachstellen gibt es künftig keinen offiziellen Schweregrad mehr. Die Priorisierungsarbeit, die bisher unsichtbar von einer amerikanischen Behörde geleistet wurde, ist ins eigene Haus gewandert. Wer sein Schwachstellenmanagement auf CVSS-Werte aus der NVD gestützt hat — und das sind die meisten —, hat still einen Lieferanten verloren.
Warum die Angreifer trotzdem schneller werden
Es wäre falsch, aus der niedrigen Ausnutzungsquote Entwarnung abzuleiten. Zwei Zahlen aus demselben VulnCheck-Bericht zeigen, warum.
Erstens: Die mittlere Zeitspanne zwischen Veröffentlichung einer CVE und der bestätigten Ausnutzung ist von 120 Tagen im Jahr 2025 auf 80 Tage im ersten Halbjahr 2026 gefallen. Was ausgenutzt wird, wird also ein Drittel schneller ausgenutzt.
Zweitens: 23,4 Prozent der tatsächlich angegriffenen Schwachstellen wurden am Tag der Veröffentlichung oder davor bereits ausgenutzt. Bei fast jeder vierten relevanten Lücke ist der Angreifer also nicht später dran als der Verteidiger, sondern früher — Patchen ist dort per Definition zu spät.
Das Verhältnis von tatsächlich ausgenutzten zu insgesamt gemeldeten Schwachstellen fiel derweil auf 1,4 Prozent, den niedrigsten je gemessenen Wert. Beide Bewegungen zusammen ergeben das eigentliche Bild: Der Heuhaufen wächst schneller als die Zahl der Nadeln, und die Nadeln, die es gibt, werden schneller gefunden. Das ist keine Entwarnung, sondern eine Verschiebung der Anforderung — weg von Vollständigkeit, hin zu Treffsicherheit.
Wo die Nadeln liegen, ist dabei erstaunlich stabil: Content-Management-Systeme machten mit 163 Fällen ein Drittel aller bekannten Ausnutzungen aus, angeführt von WordPress-Plugins; dahinter folgen Netzwerk-Randgeräte mit 68, Betriebssysteme mit 44 und Serversoftware mit 40. Eine neue Kategorie kommt hinzu: die KI-Infrastruktur selbst. VulnCheck verzeichnet Angriffe auf Werkzeuge zum Modellbau, Skalierungsplattformen, KI-Gateways und Automatisierungsabläufe — beim Werkzeug LangFlow etwa mit Diebstahl von Zugangsdaten und Versuchen, sich im Netz weiterzubewegen.
Die Ökonomie der Meldung kippt
Parallel bricht am anderen Ende der Kette ein Mechanismus weg, der zwei Jahrzehnte lang funktioniert hat. Prämienprogramme beruhen auf einer Asymmetrie: Eine Schwachstelle zu finden war teuer, sie zu prüfen vergleichsweise billig. Sprachmodelle haben diese Asymmetrie umgedreht. Einen plausibel formulierten Bericht erzeugt man in Sekunden; ihn zu widerlegen kostet weiterhin Stunden qualifizierter Arbeit.
Die Folgen sind seit anderthalb Jahren sichtbar. Das Projekt curl stellte sein Prämienprogramm Ende Januar 2026 ein — in sechs Jahren hatte kein einziger KI-generierter Bericht eine echte Lücke aufgedeckt. Der Internet Bug Bounty setzte die Annahme zeitweise aus. Und am 3. August zog Apple nach: Obergrenze für Einreichungen pro Person, 30 Tage Wartezeit bei Erreichen des Limits, 180 Tage Sperre bei wiederholten ungeprüften KI-Berichten, dauerhafter Ausschluss im Wiederholungsfall.
Apples zweite Maßnahme ist die interessantere und wird meist überlesen: Der Konzern erhöht gleichzeitig die Höchstprämie auf über fünf Millionen Dollar und führt einen Mechanismus namens target flags ein — einen maschinell prüfbaren Nachweis, dass ein gemeldeter Angriff tatsächlich funktioniert. Das ist die strukturell richtige Antwort auf das Problem. Nicht die Menge der Meldungen begrenzen, sondern den Beweis automatisieren, damit Prüfaufwand wieder mit Meldeaufwand mitskaliert.
Was Entscheider daraus mitnehmen sollten
Drei Konsequenzen sind unmittelbar handlungsrelevant.
Erstens: Die Priorisierungslogik muss umgestellt werden. Wenn für 80 Prozent der neuen Schwachstellen kein offizieller Schweregrad mehr kommt, ist ein Prozess, der auf CVSS-Werten aus der NVD beruht, faktisch blind. Die Ersatzsignale existieren und sind kostenlos: der KEV-Katalog der CISA listet Schwachstellen, für die eine Ausnutzung tatsächlich belegt ist; EPSS schätzt für jede CVE die Wahrscheinlichkeit einer Ausnutzung in den nächsten 30 Tagen. Beides sind Wahrscheinlichkeits- statt Schweregradmaße — und damit näher an der Frage, die ein Unternehmen wirklich beantworten muss.
Zweitens: Vollständigkeit ist als Ziel gestorben. Bei über 60.000 Schwachstellen im Jahr und einer Ausnutzungsquote von 1,4 Prozent ist ein Rückstand von null keine erreichbare Kennzahl mehr, sondern eine, die Aufmerksamkeit von den relevanten Fällen abzieht. Die sinnvolle Steuerungsgröße ist nicht die Zahl offener Findings, sondern die Zeit bis zum Patch bei den wenigen Lücken, die nachweislich angegriffen werden. Wer den KEV-Katalog binnen 72 Stunden abarbeitet, ist besser aufgestellt als jemand, der einen Berg unpriorisierter Meldungen langsam abträgt.
Drittens: Der Zulieferer muss mitgedacht werden. Ein Drittel der Ausnutzungen betrifft Content-Management-Systeme, überwiegend über Plugins — also Software, die niemand im Unternehmen bewusst ausgewählt hat und für die es oft keinen Verantwortlichen gibt. Und die neue Kategorie KI-Infrastruktur betrifft ausgerechnet jene Werkzeuge, die in den letzten achtzehn Monaten am schnellsten und am wenigsten kontrolliert in Unternehmen eingezogen sind.
Die eigentliche Pointe des Halbjahres ist damit nicht die, die man im April erwartet hätte. Die KI hat die Angriffsseite nicht dramatisch verstärkt. Sie hat die Verteidigungsseite mit mehr Information versorgt, als deren Institutionen verarbeiten können — und ausgerechnet in diesem Moment hat die wichtigste dieser Institutionen ihre Skalierungsambition offiziell aufgegeben. Das Nadelöhr liegt nicht mehr im Finden. Es liegt im Einordnen.
- VulnCheck — State of Exploitation 1H-2026
- Infosecurity Magazine — Just 1% of AI-Discovered Vulnerabilities Exploited in the Wild
- Anthropic — Project Glasswing: An initial update
- Help Net Security — Anthropic: Claude Mythos identified 10,000+ software flaws
- NIST — NIST Updates NVD Operations to Address Record CVE Growth
- Infosecurity Magazine — NIST Drops NVD Enrichment for Pre-March 2026 Vulnerabilities
- NowSecure — The NVD Backlog Is a Symptom. Vulnerability Management Has a Scaling Problem
- CyberScoop — AI-assisted security tools are finding more bugs, but the threat level has not changed
- heise online — KI-generierte Bugs: Apple zieht die Notbremse