· 8 Artikel + Reportage + Tool-Radar + Werkstatt

Ausgabe vom 3. September 2026

Maschinell recherchiert, menschlich relevant.

Urheberrecht · Fair Use

Die US-Regierung legt dem Gericht das Urheberrecht aus — und erklärt dabei die eigene Urheberrechtsbehörde für unmaßgeblich

Hintergrund & Analyse

Am Dienstag hat das US-Justizministerium beim Bundesbezirksgericht für den südlichen Bezirk von New York ein Statement of Interest of the United States eingereicht: 20 Seiten, im konsolidierten Verfahren In Re: OpenAI, Inc. Copyright Infringement Litigation (25-md-3143) vor Richter Sidney H. Stein, in dem die Klage der New York Times vom Dezember 2023 mit gut anderthalb Dutzend weiteren Urheberrechtsklagen zusammengefasst ist. Unterzeichnet haben Associate Attorney General Stanley E. Woodward Jr. und Brett Shumate, der die Zivilabteilung leitet. Rechtsgrundlage ist 28 U.S.C. § 517 — eine Vorschrift, die dem Ministerium erlaubt, sich ungefragt einzuschalten; sie „enthält keine zeitliche Begrenzung und erfordert keine Zustimmung des Gerichts“, wie der Schriftsatz in einer Fußnote selbst festhält.

Der erste Satz benennt das Interesse: „Die Vereinigten Staaten haben ein starkes Interesse daran, weiterhin eine robuste und wettbewerbsfähige Industrie für künstliche Intelligenz zu entwickeln, die weltweit den Maßstab für Praxis und Verfahren der KI-Nutzung setzt.“ Belegt wird das mit zwei Präsidialerlassen — dem vom 23. Januar 2025 („Removing Barriers to American Leadership in Artificial Intelligence“) und einem jüngeren vom 2. Juni 2026 („Promoting Advanced Artificial Intelligence Innovation and Security“) — sowie einem Bericht des Rechnungshofs GAO von 2022, wonach ein Verzicht auf KI die nationale Sicherheit gefährde. Der Schluss lautet: Rechtsregeln, die den Aufbau einer starken KI-Industrie erschweren, verschafften ausländischen Gegnern einen Vorteil.

Entscheidend für die Einordnung ist aber, was der Schriftsatz nicht abdeckt. Er unterscheidet ausdrücklich drei Stufen — Beschaffung der Daten, Training, Erzeugung von Ausgaben — und äußert sich allein zur mittleren. Fußnote 2 stellt klar, die Regierung behaupte nicht, dass irgendeine der in dem Verfahren beschriebenen Handlungen von ihr genehmigt gewesen sei. Das ist keine Formalie: Genau an der Beschaffungsstufe hängt der bislang teuerste Fall der Branche. Richter William Alsup hatte im Juni 2025 in Bartz gegen Anthropic das Training mit rechtmäßig erworbenen Büchern als Fair Use eingestuft, das Herunterladen aus Schattenbibliotheken aber nicht — Anthropic zahlte anschließend 1,5 Milliarden Dollar Vergleich. Für die Klagen, über die wir zuletzt am 31. August berichtet haben, in denen Musikverlage Anthropic gerade die Beschaffung über BitTorrent und das Entfernen von Rechtevermerken vorwerfen, hilft die Position der Regierung also nicht.

Der eigentlich bemerkenswerte Teil steht in der Mitte des Papiers, und er richtet sich nicht gegen die New York Times, sondern gegen ein Bundesgericht. Richter Vince Chhabria hatte in Kadrey gegen Meta — formal ein Sieg für Meta — die Auffassung vertreten, KI-Training könne den Markt für die Originale auch indirekt „verwässern“, indem die Modelle den Markt mit konkurrierenden Werken fluten. Das Justizministerium nennt diese Passage „gegenläufige Dicta, die urheberrechtliche Grundsätze auf das Training großer Sprachmodelle falsch anwenden“, und wird dann sehr deutlich: Die Anwendung des vierten Fair-Use-Faktors sei „zutiefst fehlerhaft“, das Gericht habe Training und Ausgabe „unzulässig zu einer einzigen fortlaufenden Nutzung zusammengezogen“. Auch der Umstand, dass Chhabria selbst einräumte, seine Theorie habe „in noch keinem Fall je einen Unterschied gemacht“, wird gegen ihn verwendet.

In Fußnote 17 geht der Schriftsatz einen Schritt weiter — dorthin, wo die Regierung sich selbst widerspricht. Das US Copyright Office hatte im Mai 2025 eine ähnliche Marktverwässerungs-Theorie vertreten. Dazu hält das Justizministerium fest, die Leiterin der Behörde, „die derzeit gegen ihre Abberufung klagt“, habe eine solche Auffassung geäußert, aber: „Ihr Verständnis verdient keine Deferenz.“ Zitiert wird Loper Bright, die Entscheidung von 2024, mit der der Supreme Court die Bindung an Behördenauslegungen abgeschafft hat. Eine Regierung bittet hier ein Gericht, die Fachbehörde derselben Regierung zu ignorieren — und erwähnt im selben Atemzug den Streit um deren Amtsenthebung.

Der argumentative Höhepunkt ist eine literarische Analogie. Um zu zeigen, wohin Chhabrias Logik führe, erinnert das Papier daran, dass die junge Joan Didion Erzählungen von Ernest Hemingway abtippte, „um zu lernen, wie die Sätze funktionierten“ — nach der Kadrey-Logik hätte sie für jeden veröffentlichten Text an Hemingway zahlen müssen. Ungewöhnlich ist auch die Belegwahl: Neben Supreme-Court-Entscheidungen zitiert der Schriftsatz ein Online-Magazin, ein Substack-Blog und das Portal Pirate Wires — letztere, um einer Reportage der New York Times über den Wasserverbrauch von Rechenzentren zu widersprechen.

Wirtschaftlich argumentiert die Regierung gegen die Klägerseite mit deren eigener Marktmacht: Lizenzgebühren könnten sich „nur die größten Technologiekonzerne“ leisten, und sie kämen „überproportional den etablierten Medienhäusern zugute, wegen der schieren Menge ihrer Veröffentlichungen“ — Lizenzschranken wirkten dann „vor allem als große Subventionen für alte Mainstream-Medienunternehmen“.

Bindend ist nichts davon. Der auf geistiges Eigentum spezialisierte Anwalt Evan Brown formulierte gegenüber Wired, Richter Stein sei nicht verpflichtet, sich beeinflussen zu lassen, werde das Papier aber „mit ziemlicher Sicherheit sehr ernst nehmen, weil es vom Justizministerium kommt“. Die New York Times antwortete über einen Sprecher, die Regierung stelle sich „auf die Seite einer Handvoll Billionen-Dollar-Konzerne, auf Kosten der unzähligen amerikanischen Kreativen, deren Arbeit sie gestohlen haben“. Für Unternehmen, die auf fremden Daten trainieren, bleibt die Lesart nüchtern: Die Regierung verteidigt das Training, nicht das Beschaffen — und die Frage, ob ein Modell fremde Texte wiedergibt, hat sie gar nicht erst angefasst.

Frontier-Modelle · Aufsicht

Astra soll im Verborgenen rechnen — und ausgerechnet ein Mitunterzeichner der Warnung muss es erklären

Hintergrund & Analyse

Vorbemerkung zur Quellenlage: Die Angabe, dass Astra dieses Verfahren einsetzt, stammt aus einem Bericht des Branchendienstes The Information vom 2. September, der sich auf eine einzelne, nicht genannte Quelle stützt. OpenAI hat die Architektur weder in einem Blogbeitrag noch in einer Systemkarte offengelegt und die Darstellung bislang nicht bestätigt. Was sich belegen lässt, ist die Reaktion darauf — und die fiel deutlich aus.

Das Verfahren heißt recurrent depth, in den Reaktionen inzwischen auch „opaque recurrence“, undurchsichtige Rekursion. Um zu verstehen, warum es beunruhigt, hilft ein Blick darauf, was heutige Denkmodelle tun. Sie rechnen, indem sie schreiben: Bevor die Antwort kommt, erzeugen sie eine Gedankenkette aus gewöhnlichen Wörtern — sichtbare Zwischenschritte, die man mitlesen kann. Recurrent depth ersetzt das Blatt Papier durch Kopfrechnen. Statt Zwischenergebnisse als Text auszugeben, schickt das Modell seinen Zustand mehrfach durch denselben Verarbeitungsblock und vertieft die Rechnung dabei, ohne dass ein einziges Wort entsteht.

Die Grundlagenarbeit dazu ist öffentlich und gut belegt. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach (arXiv 2502.05171) von Jonas Geiping und Kollegen erschien im Februar 2025; das Versuchsmodell trägt den Namen Huginn und hat 3,5 Milliarden Parameter bei 800 Milliarden Trainings-Token. Der Abstract nennt genau die Eigenschaften, die den Reiz ausmachen — und die Sorge begründen: Der Ansatz brauche keine besonderen Trainingsdaten, komme mit kleinen Kontextfenstern aus und könne „Arten des Denkens erfassen, die sich nicht leicht in Worten darstellen lassen“. Auf Testsätzen erreichte das Modell eine Leistung, die einer Rechenlast von rund 50 Milliarden Parametern entsprach.

Genau der letzte Punkt ist der Streitpunkt. Wenn das Denken sich nicht in Worten darstellen lässt, lässt es sich auch nicht mitlesen. Buck Shlegeris, Geschäftsführer der Sicherheitsorganisation Redwood Research, sagte TechCrunch: „Ich bin äußerst besorgt über die Berichte, dass Astra undurchsichtige Rekursion verwendet.“ Sein Chefwissenschaftler Ryan Greenblatt ergänzte, seine größte Sorge sei, „dass eine natürliche Fortsetzung von hier aus darin bestünde, das undurchsichtige Denken hochzuskalieren“. Der Analyst Zvi Mowshowitz formulierte es schärfer: Die Technik „spielt mit dem Feuer und riskiert ein Tabu, das OpenAI und Anthropic mühsam aufgebaut haben“.

Dieses Tabu ist dokumentiert. Im Juli 2025 erschien das Positionspapier Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety (arXiv 2507.11473) mit 41 Autorinnen und Autoren aus konkurrierenden Laboren. Die Empfehlung lautet, Entwickler von Spitzenmodellen sollten „die Auswirkungen von Entwicklungsentscheidungen auf die Beobachtbarkeit der Gedankenkette berücksichtigen“, weil diese Eigenschaft zerbrechlich sei. Auf der Autorenliste stehen unter anderem Yoshua Bengio, Dan Hendrycks, Neel Nanda, Shane Legg — und Ryan Greenblatt und Buck Shlegeris, die jetzt Alarm schlagen. Sowie Jakub Pachocki, Chefwissenschaftler von OpenAI, der die aktuelle Entscheidung nun verteidigen muss. Seine Antwort: „OpenAI arbeitet seit unseren allerersten Denkmodellen daran, die Beobachtung der Gedankenkette zu erhalten und zu nutzen. Das ist ein zentrales Ziel unseres laufenden Forschungsprogramms.“

Der ehrliche Einwand gegen die Aufregung kommt aus derselben Forschungsrichtung. Anthropic hat im Mai 2025 in Reasoning Models Don't Always Say What They Think (arXiv 2505.05410) gemessen, wie zuverlässig die sichtbare Gedankenkette das tatsächliche Vorgehen abbildet: Wenn Modelle einen im Prompt versteckten Hinweis nutzten, erwähnten sie das in ihrer Gedankenkette „häufig in weniger als 20 Prozent“ der Fälle. Die Autoren schließen daraus, die Beobachtung der Gedankenkette sei nützlich, um unerwünschtes Verhalten im Training zu bemerken, aber nicht geeignet, es auszuschließen. Die lesbare Gedankenkette war also nie ein Protokoll der Rechnung — sie war ein nützliches Nebenprodukt, das man mit etwas Glück mitlesen konnte.

Dass der Verlust dieses Nebenprodukts trotzdem zählt, hat das britische AI Security Institute bereits im Mai 2026 in dem Bericht Loss of Oversight beschrieben, gestützt auf 25 Fachgespräche: Undurchsichtiges Schließen drohe die vorhandenen Aufsichtsmethoden erheblich zu untergraben. Wir haben am 2. September berichtet, dass OpenAI Astra als erstes Modell in die eigene Stufe „kritisch“ für Cyberfähigkeiten einordnet und die Freigabe deshalb in zwei Hälften zerlegt — und dass zu den technischen Schutzmaßnahmen ausdrücklich „zusätzliche Überwachung der Gedankenketten“ gehört. Wenn der Bericht zutrifft, hätte OpenAI dieselbe Kontrolle, die es als Schutzmaßnahme aufführt, in derselben Modellgeneration architektonisch verkleinert. Genau diese Frage sollte jeder stellen, der Astra später einkauft.

Modelle · Cyberabwehr

Gemini 3.8 Flash: gleicher Preis pro Token, mehr Token pro Aufgabe — und eine Cyber-Variante hinter einem Partnerprogramm

Hintergrund & Analyse

Google DeepMind hat am Mittwoch Gemini 3.8 Flash allgemein verfügbar gemacht und ihm eine zweite Ausgabe zur Seite gestellt: Gemini 3.8 Flash Cyber. Beide laufen auf derselben technischen Grundlage — eine Million Token Kontext, 65.536 Token Ausgabe, Wissensstand März 2026, Eingabe als Text, Bild, Audio und Video. Der Unterschied liegt ausschließlich in den Schutzmaßnahmen und im Zugang. Die Preise bleiben gegenüber dem Vorgänger unverändert: 0,75 Dollar je Million Eingabe-Token, 3,75 Dollar je Million Ausgabe-Token, gültig als Einführungspreis bis zum 31. Dezember 2026; danach verdoppeln sich beide Werte auf 1,50 und 7,50 Dollar.

Interessanter als die Preistabelle ist die Warnung, die Google selbst danebenstellt. In der Modellkarte heißt es, 3.8 Flash „arbeitet härter“: Bei komplexen Aufgaben führe es zusätzliche Denkschritte aus, rufe Werkzeuge wiederholt auf und verbrauche bei höheren Anstrengungsstufen möglicherweise mehr Token. Google rät ausdrücklich, wer unter Kostendruck stehe, solle beim Vorgänger 3.7 Flash bleiben. Übersetzt heißt das: Der Preis pro Token ist gleich geblieben, der Preis pro erledigter Aufgabe nicht. Der unabhängige Messdienst Artificial Analysis beziffert die Kosten für den eigenen Testparcours auf 0,58 Dollar und nennt das Modell auffällig gesprächig — rund 120 Millionen Ausgabe-Token im gesamten Testlauf gegenüber einem Mittelwert von 71 Millionen. Wer Modellkosten budgetiert, sollte deshalb nicht die Preisliste vergleichen, sondern eine Stichprobe der eigenen Aufgaben durchrechnen.

Die Leistungszahlen selbst sind Anbieterangaben und sollten so gelesen werden. Google nennt für die Cyber-Variante 86,2 Prozent auf CyberGym, einem Testsatz zum Auffinden von Schwachstellen in C- und C++-Code, gegenüber 77,5 Prozent für die Vorgängerversion; beim automatisierten Patchen (CWE-Bench) 47,2 Prozent. Für das Standardmodell werden 73,7 Prozent auf dem Software-Entwicklungstest DeepSWE und 54,9 Prozent auf HLE-Verified angegeben. Das Chrome-Sicherheitsteam meldet in Googles Darstellung „2,6-mal mehr korrekte Patches als die besten kommerziellen Modelle“. Unabhängig gemessen liegt Gemini 3.8 Flash im Intelligence Index von Artificial Analysis bei 59 Punkten und auf Platz 17 von 196 Modellen, dafür mit rund 302 Token pro Sekunde auf Platz drei bei der Ausgabegeschwindigkeit — ein schnelles, günstiges Arbeitspferd, kein Spitzenmodell.

Der eigentliche Nachrichtenwert steckt in der Zugangsarchitektur. Die Cyber-Variante kommt laut Google mit „einem freizügigeren Satz an Cyber-Schutzmaßnahmen, und genau deshalb ist sie auf vertrauenswürdige Verteidiger beschränkt“. Vergeben wird sie einzelfallweise über ein neues Fairwind Program, das Google zeitgleich vorgestellt hat: Zielgruppe sind Regierungen und nationale Cyberbehörden, Betreiber kritischer Infrastruktur aus Gesundheitswesen, Telekommunikation, Energie und Finanzsektor sowie große Technologieplattformen. Bewerber müssen „eine nachweisliche Historie ethischen Betriebs und ethischer Forschung“ vorlegen; verlangt werden eine Prüfung der Organisation, phishing-resistente Mehrfaktor-Anmeldung und Zugriffskontrollen. Google nennt über 650 Partner weltweit, namentlich mit Zitaten vertreten sind Armadin, CrowdStrike, Palo Alto Networks, Snowflake und Wiz. Zusammen mit dem Modell wird der Agent CodeMender ausgeliefert, der Korrekturen automatisiert erzeugen soll — statt Wochen manueller Arbeit „verifizierte, auslieferungsfertige Patches in Minuten“.

Damit liegen innerhalb von 48 Stunden drei verschiedene Antworten auf dieselbe Frage vor. OpenAI hat Astra am 1. September als erstes Modell in die hauseigene Stufe „kritisch“ eingeordnet und den Zugang zu den Angriffsfähigkeiten auf Alphatester beschränkt (2. September). Anthropic hat am selben Tag Fable 5.1 frei veröffentlicht und den baugleichen Zwilling Mythos 5.1 nur über ein Cyber Verification Program für zunächst US-amerikanische Organisationen freigegeben (ebenfalls 2. September). Google löst dieselbe Aufgabe drittens — und ohne öffentliche Einstufung: In der Modellkarte heißt es lediglich, das Standardmodell werde „voraussichtlich keine der verfolgten Fähigkeitsschwellen erreichen“. Für die Cyber-Variante nennt Google keine vergleichbare öffentliche Stufe; die Steuerung läuft allein über die Aufnahme ins Partnerprogramm. Wo OpenAI eine Schwelle ausruft und Anthropic eine Prüfung verlangt, führt Google eine Gästeliste.

Bemerkenswert ist auch, was fehlt. Googles älteres Vorzeigeprojekt zur KI-gestützten Schwachstellensuche, Big Sleep, kommt in keiner der beiden Ankündigungen vor — weder im Modell-Blogpost noch auf der Fairwind-Seite. Über den aktuellen Stand des Projekts lässt sich daraus nichts schließen, wohl aber über die Erzählung: Die Schwachstellensuche wird jetzt als Produkt für zahlende und geprüfte Partner erzählt, nicht mehr als Forschungsvorhaben.

Bleibt die Kadenz. Gemini 3.6 Flash erschien Ende Juli, 3.7 Flash am 13. August, 3.8 Flash jetzt — drei Modelle in sechs Wochen, jeweils im Abstand von rund drei Wochen. Der Fachdienst The Decoder ordnet das doppeldeutig ein: Ob dieses Tempo Stärke zeige oder von den weiterhin ausstehenden Spitzenmodellen ablenke, hänge davon ab, wen man frage. Für Unternehmen bringt die Taktung ein praktisches Problem mit: Wer Modellversionen fest in Produkte einbaut, aktualisiert derzeit alle drei Wochen — oder bleibt bewusst zurück und zahlt dafür mit fehlenden Funktionen. Der Wegfall der Stufe „MINIMAL“ bei den Denkstufen ist bereits eine brechende Änderung gegenüber 3.7 Flash.

Sicherheit · Coding-Agenten

GitSpawn: Eine Zeile in der Git-Konfiguration genügt, damit Coding-Agenten fremden Code ausführen

Hintergrund & Analyse

Der Sicherheitsforscher Francisco Rosales hat am 1. September bei Manifold Security einen Bericht unter dem Titel GitSpawn: A Single Flaw Lets Untrusted Repos Run Code in Claude Code, Codex, Cursor, and Grok veröffentlicht; heise griff ihn am 2. September auf. Der Befund ist unangenehm einfach. KI-Coding-Agenten führen beim Öffnen eines Projektverzeichnisses im Hintergrund gewöhnliche Git-Befehle aus, um sich einen Überblick zu verschaffen — welcher Zweig ist aktiv, welche Dateien sind geändert. Typischerweise git status oder git diff. Diese Aufrufe geschehen still, weil sie aus Sicht des Agenten kein Nutzerbefehl sind, sondern Kontextsammlung.

Der Hebel ist die Git-Einstellung core.fsmonitor. Sie ist eine Beschleunigungsoption, und ihr Wert ist ein beliebiges Programm, das Git bei jeder Aktualisierung seines Index selbstständig aufruft. Steht dort statt eines Dateiüberwachers ein Angreiferbefehl, wird er ausgeführt — mit den vollen Rechten des angemeldeten Anwenders. Rosales beschreibt den Kern in einem Satz: Weil der Agent selbst den Unterprozess für Git startet, laufe der Befehl „außerhalb der Sandbox und ohne Freigabeabfrage“. Bei Claude Code und dem Hermes Agent geschah das noch vor der Abfrage, ob man dem Arbeitsverzeichnis vertraue; bei Qwen Code sogar vor der Anmeldung.

Genauso wichtig wie der Angriff ist seine Voraussetzung, und die schränkt die Panik ein. Ein normales git clone, fetch oder pull überträgt die Datei .git/config der Gegenseite nicht — der Angriff funktioniert also nicht über das Klonen eines bösartigen Repositorys. Er funktioniert nur, wenn ein Projektverzeichnis samt intaktem .git-Ordner als Dateien den Besitzer wechselt. Rosales zählt die Wege auf: ein weitergereichtes ZIP-Archiv, ein Netzlaufwerk, ein Synchronisationsordner, ein USB-Stick. Für den Alltag heißt das: Wer fremde Pull Requests per Klon prüft, ist über diesen Weg nicht betroffen. Wer ein zugeliefertes Projektarchiv entpackt und den Agenten daraufsetzt, sehr wohl — und das ist genau die Art, wie Beratungshäuser und Zulieferer Projekte übergeben.

Die Bilanz der Offenlegung ist der eigentliche Skandal der Geschichte. Rosales meldete die Fehler zwischen dem 26. Juni und dem 20. Juli 2026 und prüfte sie am Tag der Veröffentlichung erneut gegen aktuelle Versionen. Ergebnis: Bei Claude Code ist der Pfad über core.fsmonitor seit Version 2.1.196 geschlossen. Ein zweiter Pfad, den Rosales als ultrareview bezeichnet und der über eine andere Einstellung derselben Art läuft, war am 1. September in Version 2.1.252 noch offen — die Meldung war als Duplikat eines internen Tickets geschlossen worden. Bei Goose vergab der Hersteller eine CVE und lieferte einen Patch (Version 1.44.0). Ungepatcht blieben zum Veröffentlichungszeitpunkt Qwen Code (0.22.3, Meldung von Alibaba angenommen), Grok Build (1.0.13, als Duplikat geschlossen) und der Hermes Agent von Nous Research (0.21.0), wo nach sechs Kontaktversuchen keinerlei Reaktion erfolgte. Die deutsche Berichterstattung schreibt an dieser Stelle „ultraview“; im Originalbericht heißt der Pfad „ultrareview“.

Die einzige der genannten Schwachstellen mit einer verifizierten Kennung ist die von Goose: CVE-2026-72718, im GitHub-Advisory GHSA-r5pp-p5r8-466r mit einem Schweregrad von 7,0 bewertet und am 24. Juli veröffentlicht. Der Titel des Advisory nennt den Mechanismus wörtlich beim Namen — Codeausführung über git core.fsmonitor. Aufschlussreich ist die Fehlerursache: Der betroffene Code bereinigte die Git-Konfiguration durchaus, aber nur den Eintrag core.quotePath, nicht core.fsmonitor. Eine unvollständige Liste ist hier ebenso wirkungslos wie keine.

Neu ist an dem Mechanismus wenig, und das ist der beunruhigende Teil. Die Beratungsfirma Cobalt hatte dieselbe Technik bereits im Dezember 2025 als Angriffsweg für Entwicklungsumgebungen beschrieben — Visual Studio Code führt beim Öffnen eines Ordners ebenfalls automatisch git status aus. Sonar fand genau dieselbe Lücke in Claude Code und meldete sie so früh, dass Anthropic sie am 16. Dezember 2025 schloss; ein halbes Jahr später war sie in derselben Software wieder da. Rosales zieht daraus den Schluss, der den Bericht trägt: Die Schwachstelle liege „nicht im Modell und in nichts Neuem, sondern in der gewöhnlichen Installation darunter“. Jeder untersuchte Agent habe eine Variante desselben unbereinigten Ablaufs.

Die empfohlene Gegenmaßnahme ist entsprechend banal. Für Hersteller: die Konfiguration bei den Hintergrundaufrufen entschärfen, also git -c core.fsmonitor=false status statt git status. Für Anwenderinnen und Anwender: vor dem Öffnen eines fremden Verzeichnisses mit einem Agenten die Datei .git/config ansehen. Jede Einstellung, die ein Programm benennt, kann dieses Programm starten. Wer Agenten in Unternehmen betreibt, sollte den Punkt allerdings grundsätzlicher fassen: Ein Agent, der ein fremdes Verzeichnis öffnet, führt fremde Konfiguration aus. Das ist dieselbe Lehre, die die Veröffentlichung von OpenClaw 2.0 vor zwei Tagen bereits nahegelegt hat, wo das Sandboxing für nicht vertrauenswürdigen Code standardmäßig abgeschaltet ist.

Haftung · Produktverantwortung

30 neue Klagen gegen OpenAI: Aus Fahrlässigkeit wird der Vorwurf der Beihilfe

Hintergrund & Analyse

Vorbemerkung: Es geht im Folgenden um eine Gewalttat und um Vorwürfe, über die kein Gericht entschieden hat. Alles, was aus den Klageschriften stammt, ist eine Behauptung der Klägerseite, kein festgestellter Sachverhalt. Namen von Opfern und Angehörigen nennen wir nicht.

Die Kanzlei Edelson PC hat am Mittwoch 30 weitere Klagen gegen OpenAI und dessen Vorstandsvorsitzenden Sam Altman beim Bundesbezirksgericht für den nördlichen Bezirk von Kalifornien eingereicht. Zusammen mit einer ersten Welle von sieben Klagen vom 29. April 2026 laufen damit 37 Verfahren. Kläger sind nach Darstellung von Global News Lehrkräfte, eine Schulleitung und Schülerinnen und Schüler, die sich beim Angriff auf die Tumbler Ridge Secondary School im Gebäude befanden, aber nicht angeschossen wurden.

Zum Sachverhalt selbst ist die Faktenlage klar und behördlich belegt: Nach der Mitteilung der kanadischen Bundespolizei RCMP ereignete sich der Angriff am 10. Februar 2026 gegen 13:20 Uhr Ortszeit im Ort Tumbler Ridge in British Columbia. Neun Menschen starben, zwei davon in einem Wohnhaus, sieben an der Schule — darunter die 18-jährige tatverdächtige Person, die laut RCMP wenige Minuten nach Beginn tot aufgefunden wurde, mit einer offenbar selbst zugefügten Verletzung. Ein Strafverfahren gegen eine lebende Person gibt es deshalb nicht; was bleibt, sind Zivilklagen.

Der juristische Kern ist die Umstellung der Anspruchsgrundlage. Die bisherigen Verfahren argumentierten mit Fahrlässigkeit — OpenAI habe eine Sorgfaltspflicht verletzt, indem es die Tat nicht verhinderte. Die neuen Klagen werfen dem Unternehmen zusätzlich „aiding and abetting“ vor, also Beihilfe, konkret „substanzielle Unterstützung und Ermutigung“. Dazwischen liegt ein erheblicher Unterschied im Maßstab: Fahrlässigkeit verlangt die Verletzung einer Sorgfaltspflicht, Beihilfe verlangt Kenntnis von der drohenden Tat und eine tatsächliche Unterstützungshandlung. Der Vorwurf ist also schwerer zu beweisen — aber er hat einen taktischen Vorteil. Nach der Einschätzung des Verfahrensbeobachters Lawsuit Informer ist die auf den Betrieb und die Gestaltung des Systems gerichtete Variante der Theorie diejenige, die einer frühen Abweisung unter Berufung auf Section 230 am wenigsten ausgesetzt ist.

Die tragende Tatsachenbehauptung betrifft nicht das Modell, sondern eine Entscheidung im Unternehmen. Nach den Klageschriften hatte OpenAIs internes Team für Auswertung und Ermittlungen das Konto der später tatverdächtigen Person bereits im Juni 2025 — rund acht Monate vor der Tat — wegen gewaltbezogener Eingaben markiert und empfohlen, die kanadische Polizei zu informieren; diese Empfehlung sei überstimmt worden. Benannt wird in der Sachverhaltsdarstellung Chris Lehane, OpenAIs Chief Global Affairs Officer. TechCrunch weist ausdrücklich darauf hin, dass die Klageschrift diese Zuschreibung mit der Formel „nach bestem Wissen und Glauben“ versieht und keinen direkten Beleg für seine persönliche Beteiligung liefert; nach TechCrunch und NPR ist Lehane nicht als Beklagter geführt, wohl aber Altman persönlich. Eine weitere Veröffentlichung stellt das anders dar; wir folgen den beiden übereinstimmenden Quellen und halten den Punkt für nicht abschließend geklärt.

OpenAI widerspricht deutlich. Chief Strategy Officer Jason Kwon erklärte: „Es ist absolut falsch zu sagen, Chris Lehane sei beteiligt gewesen.“ Die Entscheidung, ob die Polizei eingeschaltet werde, folge einem internen Maßstab — einem „unmittelbaren und glaubhaften Risiko“. Dieses Urteil sei „nicht unfehlbar, aber es beruht immer darauf, diese Abwägung für Menschen im Blick zu behalten“. In einer allgemeineren Stellungnahme verweist das Unternehmen darauf, man habe die Schutzmaßnahmen bereits verstärkt, „einschließlich der Art, wie ChatGPT auf Anzeichen von Belastung reagiert“.

Die Kläger führen dagegen einen Vergleich ins Feld, der rhetorisch wirksam ist: Im November 2025 habe OpenAI seine Büros in San Francisco wegen einer Drohung vorsorglich geschlossen und die Polizei eingeschaltet, obwohl es keinen Hinweis auf eine aktive Bedrohung gegeben habe. Sinngemäß: Als die eigenen Leute betroffen waren, habe kein Datenschutzinteresse die Benachrichtigung der Polizei aufgehalten. Die Gesprächsprotokolle selbst sind bislang nicht öffentlich; die Klagen beschreiben sie nur zusammenfassend als gewaltbezogene Szenarien und verlangen ihre Herausgabe erst im Beweisverfahren. Die Beweislage ist an dieser Stelle also ausdrücklich offen.

Eine gerichtliche Klärung der Grundsatzfragen fehlt weiterhin. In keinem der Personenschadensverfahren gegen OpenAI gibt es bislang eine Sachentscheidung; Entscheidungen über Abweisungsanträge zu Section 230 und dem ersten Verfassungszusatz werden für das späte Jahr 2026 erwartet. Der bislang wichtigste Anhaltspunkt stammt aus einem anderen Verfahren: In Garcia gegen Character Technologies lehnte Richterin Anne Conway im Mai 2025 einen Abweisungsantrag ab und hielt fest, sie sei „nicht bereit zu entscheiden, dass die Ausgabe eines Sprachmodells Rede ist“. Zu einem Präzedenzurteil kam es nicht — der Fall wurde im Januar 2026 verglichen.

Für Unternehmen, die selbst Systeme mit Risikoerkennung betreiben, liegt der lehrreiche Teil nicht im Ausgang, sondern in der Angriffsfläche. Der Vorwurf zielt nicht auf eine Modellausgabe, sondern auf eine dokumentierte interne Eskalationsentscheidung: Wer hat wann was gewusst, wer hat entschieden, es nicht weiterzugeben, und nach welchem Maßstab. Ein Erkennungssystem einzubauen erzeugt genau diese Aktenlage — und mit ihr die Frage, was mit einem Treffer geschieht. Ein unklarer oder nirgends niedergelegter Eskalationsmaßstab ist deshalb kein organisatorisches Detail, sondern ein Haftungsrisiko.

Infrastruktur · Stromnetz

474 Gigawatt in der Warteschlange: Texas prüft, wie viel der Rechenzentrums-Nachfrage es überhaupt gibt

Hintergrund & Analyse

Für den Begriff hat sich in der amerikanischen Debatte ein Wort eingebürgert, das die Sache gut trifft: Geister-Nachfrage. Gemeint ist Folgendes: Ein Entwickler, der ein Rechenzentrum plant, reicht Anschlussanfragen bei mehreren Versorgern gleichzeitig ein — für dasselbe Vorhaben. Er sichert sich damit Plätze in mehreren Warteschlangen, ohne feste Kunden oder gesicherte Finanzierung nachweisen zu müssen, und entscheidet später, welchen Standort er tatsächlich nimmt. Für den einzelnen Entwickler ist das vernünftig, weil Grundstücks- und Genehmigungsrisiken real sind. Für die Netzplanung ist es Gift, weil dieselbe Anlage mehrfach als Bedarf gezählt wird. Die Nachrichtenagentur Reuters hat den Vorgang am 1. September in einer Auswertung von Versorgerdaten aufgearbeitet; heise berichtete tags darauf.

Die Größenordnung ist bemerkenswert. In der Warteschlange des texanischen Netzbetreibers ERCOT stehen inzwischen 474 Gigawatt — 2023 waren es rund 48. Etwa 90 Prozent davon entfallen auf Rechenzentren. Zum Vergleich: Das ist ungefähr das Fünffache der höchsten Last, die ERCOT je gemessen hat. Über die von Reuters betrachteten Regionen im Mittleren Westen, dem mittleren Atlantik und dem Süden summieren sich die Anfragen auf über 700 Gigawatt, mehr als das Zehnfache dessen, was Rechenzentren in den USA heute tatsächlich verbrauchen.

Dass ein erheblicher Teil davon nicht existiert, lässt sich nicht direkt messen, aber indirekt sehr gut zeigen: Man muss die Anfragen nur etwas kosten lassen. Nachdem AEP Ohio eine Gebühr von bis zu 100.000 Dollar für die Anschlussstudie eines 100-Megawatt-Projekts eingeführt hatte, schrumpfte die Projektliste um mehr als die Hälfte. Der Versorger Exelon strich im Juli 2026 seine als „hochwahrscheinlich“ geführte Nachfrage um rund 40 Prozent auf 11 Gigawatt zusammen. Eine belastbare Gesamtquote nennt keine der Quellen — es gibt sie schlicht nicht.

Die Aufsicht reagiert, und zwar in mehreren Bundesstaaten gleichzeitig. Der texanische Gouverneur Greg Abbott ordnete am 3. August 2026 eine Prüfung sämtlicher Rechenzentren in der ERCOT-Warteschlange an; untersucht werden Eigentümerstruktur, Steuervergünstigungen, Wasser- und Kühlungsbedarf sowie eigene Erzeugungskapazität. ERCOT verschob daraufhin einen ganzen Planungsdurchgang. In Virginia wies die Regulierungskommission am 31. Juli 2026 an, dass Dominion Energy die Übertragungskosten für direkt angeschlossene Großlasten unmittelbar zuweisen muss; der ab Januar 2027 geltende Tarif für Kunden ab 25 Megawatt verlangt eine Mindestabnahme von 85 Prozent der kontrahierten Übertragungs- und 60 Prozent der Erzeugungskapazität — bezahlt wird also auch, was nicht abgenommen wird. Der rechnerische Effekt für Haushaltskunden: eine erwartete monatliche Mehrbelastung von 2,90 Dollar sinkt auf 94 Cent. Pennsylvania verschärfte am 18. August die Transparenzpflichten für Projekte ab 25 Megawatt. Bis Mitte 2026 hatten laut Branchenerhebungen über zwanzig Bundesstaaten einen eigenen Großlast-Tarif beschlossen.

Die Gegenthese verdient eine faire Darstellung: Ein großer Teil der Nachfrage ist echt. Das Electric Power Research Institute rechnet in Powering Intelligence 2026 damit, dass Rechenzentren bis 2030 zwischen 9 und 17 Prozent des amerikanischen Stroms verbrauchen könnten, nach rund 4 Prozent im Jahr 2023. Die Energiebehörde EIA erwartet in ihrem Ausblick vom 8. April 2026, dass Elektrofahrzeuge und Rechenzentren zusammen 50 bis 80 Prozent des gesamten Nachfragewachstums bis 2050 ausmachen. Beides sind Prognosen, keine Messwerte — und darin liegt das Problem: Die Warteschlangen sind derzeit die einzige Datenquelle für die Zukunft, und sie ist erkennbar aufgebläht.

Bei der Frage, wer das bezahlt, widerspricht sich die Faktenlage nur scheinbar. Ein Weißbuch der Beratung E3 vom 18. Mai 2026 findet keinen Beleg dafür, dass Rechenzentren die Preise für Haushaltskunden getrieben hätten — Staaten mit dem stärksten Lastwachstum hatten geringere Preissteigerungen als Staaten mit sinkender Last. Die Arbeit wurde von der Data Center Coalition finanziert, dem Branchenverband der Betreiber. Dagegen stehen die Kapazitätsauktionen des Netzverbunds PJM, wo der Preis von 28,92 Dollar je Megawatt und Tag für 2024/25 auf 269,92 und dann 329,17 Dollar sprang; die unabhängige Marktaufsicht führte 63 Prozent des Anstiegs in der Auktion 2025/26 auf Rechenzentren zurück, was rund 9,3 Milliarden Dollar an weitergereichten Kosten entspricht. Beides kann zutreffen: Wo Kapazität im Überschuss vorhanden ist, verteilen Großkunden die Fixkosten auf mehr Schultern; wo sie knapp ist, treiben sie den Grenzpreis.

Für unsere Leserschaft schließt sich hier ein Kreis. Der Rechenzentrums-Campus Beacon Point in Nueces County, Texas, ist derselbe, über den wir am 2. September im Zusammenhang mit dem 35-Milliarden-Dollar-Vertrag zwischen Anthropic, Lambda und Nvidia berichtet haben. Nach einer Analystennotiz gehört er zu den 23 Vorhaben, die die texanische Prüfung weiterlaufen dürfen; der Betreiber Hut 8 hält an der Inbetriebnahme im ersten Quartal 2027 fest. Anders gesagt: Der milliardenschwere Vertrag, den wir vorgestern als Finanznachricht behandelt haben, hängt an einem Genehmigungsverfahren, das es vor vier Wochen noch nicht gab.

Praktisch bleiben zwei Dinge. Erstens: Eine Zahl aus einer Anschlusswarteschlange ist keine Bedarfsprognose, sondern eine Option — wer Marktgrößen für KI-Rechenleistung daraus ableitet, rechnet mit Doppelzählungen. Zweitens: Die neuen Mindestabnahme-Tarife verschieben das Risiko vom Netz zum Betreiber, und wer 85 Prozent seiner kontrahierten Leistung ohnehin bezahlt, rechnet das in seine Preise ein. Wer 2027 Rechenzeit einkauft, zahlt mit für die Warteschlangen von 2026.

Bildung · Regulierung

New York nimmt 600.000 Kindern die generative KI weg — in der deutschen Oberstufe verzichten vier Prozent freiwillig

Hintergrund & Analyse

Bürgermeister Zohran Kwame Mamdani und Schulkanzler Kamar H. Samuels haben am Mittwoch für die New York City Public Schools ein einjähriges Moratorium für generative KI angekündigt. Es gilt im Schuljahr 2026/27 und betrifft nach Angaben der Stadt knapp 600.000 Schülerinnen und Schüler — von 2-K bis zur achten Klasse und damit rund zwei Drittel aller Eingeschriebenen. 2-K ist dabei kein Tippfehler und auch nicht die zweite Klasse, sondern ein 2026 gestartetes städtisches Betreuungsangebot für Zweijährige. Untersagt ist jede an Schüler gerichtete generative KI-Software; Begleit-Chatbots sind darüber hinaus in allen Klassenstufen verboten, auch an der Highschool.

Das Paket geht über KI hinaus. Für Vorschule bis zweite Klasse entfallen persönliche Geräte ganz, Smartboards bleiben erlaubt; in den Klassen drei bis fünf gilt eine Obergrenze von 30 Minuten Einzelgerätezeit pro Tag, in den Klassen sechs bis acht 45 Minuten. Für Highschool-Klassen bleiben fünf zentral genehmigte Pilotprogramme mit engen Zeitbudgets übrig — etwa Quill für Textanalyse mit höchstens 15 Minuten pro Woche und Edia für Mathematik-Coaching mit höchstens 20 Minuten. Höchstens 50.000 Oberstufenschüler sollen daran teilnehmen; zweimal im Jahr wird für alle ein Pflichtmodul zum kritischen Umgang mit KI fällig. Lehrkräfte dürfen KI weiterhin für Unterrichtsplanung, Übersetzungen und Verwaltungskommunikation nutzen — nicht aber für Benotung, Verhaltensbeobachtung, Beratung oder sonderpädagogische Förderpläne. Ausgenommen bleiben assistive Technik für Kinder mit Behinderungen und Angebote für mehrsprachige Lernende.

Bemerkenswert ist ein Detail der Umsetzung: Die Behörde schaltet in nach eigenen Angaben knapp 40 bereits zugelassenen Lernprogrammen die KI-Bestandteile ab, weil sie die neuen Sicherheitsanforderungen nicht erfüllen. Eine vollständige Liste dieser Produkte hat die Stadt bislang nicht veröffentlicht. Für Anbieter von Bildungssoftware ist das die eigentliche Nachricht — nicht das Verbot eines Chatbots, sondern die stille Deaktivierung von Funktionen in Verträgen, die längst laufen.

Die Begründung fällt betont unökonomisch aus. „Kinder brauchen Lehrkräfte und menschliche Beziehung, um zu lernen und zu wachsen“, wird Mamdani zitiert; Samuels ergänzt, man setze Leitplanken, „um die menschliche Verbindung, die Neugier und die Kreativität zu schützen, die Kindern beim Aufwachsen helfen“. Eine namentlich zitierte Studie steht in der Mitteilung nicht.

Wer den Vorgang für einen Reflex hält, unterschätzt die Vorgeschichte. New York hatte ChatGPT im Januar 2023 in Schulnetzen gesperrt und die Sperre im Mai 2023 unter dem damaligen Schulkanzler David Banks wieder aufgehoben — mit der Begründung, die anfängliche Vorsicht habe das Potenzial der Technik übersehen. Die jetzige Verwaltung kehrt also um, und zwar breiter als 2023. Dazwischen liegt ein Beteiligungsverfahren, das für jede Organisation lehrreich ist, die selbst KI-Richtlinien schreibt: Ein im März 2026 vorgelegter Leitlinienentwurf mit 45-tägiger Kommentierungsfrist zog über 6.000 Stellungnahmen nach sich, knapp die Hälfte davon von Lehrkräften; 29 von 51 Mitgliedern des Stadtrats forderten im Juni eine sofortige Pause. Die für Juni angekündigte Endfassung wurde daraufhin zurückgezogen — Samuels räumte gegenüber Chalkbeat ein, man habe „danebengelegen“. Was jetzt gilt, ist die zweite Fassung nach öffentlichem Widerspruch.

Die Lehrergewerkschaft UFT trägt das Ergebnis mit, aber nicht begeistert. Präsident Michael Mulgrew begrüßte vor allem die Bildschirmzeit-Grenzen und verlangte, die Behörde müsse beim Einkauf härter auf eingebaute Schutzmechanismen bestehen. Die Landesgewerkschaft NYSUT hatte bereits im Mai 2026 eine entsprechende Resolution beschlossen. Der Branchenverband Tech:NYC unterstützt Leitplanken, wirbt aber dafür, die Berufsvorbereitungs-Pilotprojekte über eine Stunde pro Woche hinaus auszuweiten. Eine Stellungnahme von OpenAI zu der Entscheidung ist uns nicht bekannt.

Der zweite Befund des Tages kommt aus Deutschland und steht quer dazu. Für eine Civey-Umfrage im Auftrag von Vodafone wurden 1.000 Schülerinnen und Schüler zwischen 16 und 19 Jahren befragt. Bei der Recherche für Referate und Hausarbeiten verzichten zwei Prozent vollständig auf KI; 69 Prozent nutzen sie mindestens mehrmals pro Woche, ein Viertel täglich. Beim Erledigen von Hausaufgaben verzichten vier Prozent ganz. Gleichzeitig sagen 30 Prozent, KI werde im Unterricht selten oder nie behandelt. Bei der Frage, was sich ändern soll, votiert eine relative Mehrheit von 48 Prozent nicht für ein eigenes Schulfach, sondern für die verbindliche Einbettung in die bestehenden Fächer.

Beides zusammen ergibt ein Zeitproblem, und es betrifft Unternehmen unmittelbar. New Yorks Moratorium wirkt dort, wo Gewohnheiten noch entstehen — bei Kindern bis zur achten Klasse. Die Kohorte, die in zwei bis drei Jahren in Ausbildung, Studium und erste Jobs kommt, hat ihre Gewohnheiten längst gebildet, und zwar ohne Anleitung: Die deutschen Zahlen zeigen eine nahezu vollständige Nutzung bei gleichzeitig lückenhaftem Unterricht dazu. Die Frage für Personalentwicklung und Produktteams lautet deshalb nicht, ob Berufseinsteiger KI nutzen werden, sondern ob irgendjemand ihnen je beigebracht hat, die Ergebnisse zu prüfen. Anzumerken bleibt, dass die beiden Befunde aus unterschiedlichen Ländern und Altersgruppen stammen; sie sind kein direkter Vergleich, sondern zwei Symptome derselben Entwicklung.

KI-Erkennung · Vertrauen

Der Goldstandard der KI-Erkennung und die Rechnung, die niemand aufmacht

Hintergrund & Analyse

Wired hat am Mittwoch ein langes Porträt über Pangram veröffentlicht, und der Untertitel stellt die richtige Frage: Sollte man diesem Werkzeug trauen? Pangram ist ein Detektor für KI-generierte Texte, gegründet 2023 von Max Spero und Bradley Emi, beide zuvor in der maschinellen Lernpraxis bei Google, Tesla und Nuro, Sitz Brooklyn, 24 Beschäftigte. Im Juli 2026 sammelte das Unternehmen eine Series A über neun Millionen Dollar unter Führung von Menlo Ventures ein, insgesamt rund 13 Millionen. Genutzt wird es unter anderem von Substack, NewsGuard und Quora sowie von Verlagen und Universitäten.

Anders als die meisten Anbieter dieser Kategorie hält Pangram akademischer Prüfung stand. In einem Arbeitspapier des National Bureau of Economic Research (Nr. 34223, Brian Jabarian und Alex Imas, August 2025) war Pangram das einzige getestete Werkzeug, das eine strenge Obergrenze für Falsch-Positive einhielt, ohne dafür Trefferquote zu opfern; quelloffene Alternativen stuften im selben Test bis zu 78 Prozent menschlicher Texte fälschlich als KI ein. Der Anbieter selbst beziffert seine Genauigkeit auf 99,98 Prozent und die Rate falscher Beschuldigungen auf etwa eins zu zehntausend — diese Zahl ist eine Herstellerangabe und wurde in dieser Form nicht unabhängig nachgeprüft.

Nimmt man sie trotzdem für bare Münze, beginnt das eigentliche Problem. Der Princeton-Informatiker Arvind Narayanan hat die naheliegende Rechnung aufgemacht: Bei einer Fehlerquote von eins zu zehntausend und der Menge an Texten, die über vier Studienjahre durch solche Systeme laufen, würden trotzdem fünf bis zehn Prozent der Studierenden mindestens einmal zu Unrecht beschuldigt. Das ist kein Vorwurf an die Technik, sondern eine Eigenschaft großer Zahlen: Eine sehr kleine Fehlerrate mal einer sehr großen Grundmenge ergibt eine sehr große Zahl an Einzelfällen. Wer solche Werkzeuge einführt, kauft nicht Gewissheit, sondern eine kalkulierbare Menge an Unrecht.

Wie sich das anfühlt, hat im Mai 2026 die Journalistin Taylor Lorenz erlebt, die auf X öffentlich beschuldigt wurde, einen Artikel mit KI geschrieben zu haben. Spero prüfte den Fall selbst nach und bestätigte einen Fehlbefund. Lorenz sagte anschließend, sie sei danach „so paranoid“ gewesen. Ein weiterer dokumentierter Schwachpunkt ist die Reproduzierbarkeit: Ein Redakteur des Wall Street Journal wies nach, dass derselbe Text bei wiederholter Prüfung einmal als vollständig menschlich und einmal als vollständig maschinell eingestuft wurde, und nannte das Werkzeug daraufhin eine „Verleumdungsmaschine“.

Dazu kommt eine Verzerrung, die seit Jahren belegt ist und die Detektoren als Klasse betrifft. Eine Stanford-Arbeit von Weixin Liang und Kollegen (arXiv 2304.02819, erschienen 2023 in Patterns) zeigte, dass mehr als die Hälfte der von Nicht-Muttersprachlern verfassten TOEFL-Aufsätze fälschlich als KI-generiert eingestuft wurde, während Aufsätze amerikanischer Achtklässler nahezu fehlerfrei erkannt wurden. Die vermutete Ursache ist banal und deshalb schwer zu beheben: Wer eine Fremdsprache schreibt, verwendet weniger überraschende Wörter — und genau daran erkennen Detektoren maschinelle Texte. Eine vergleichbar belastbare Untersuchung dazu, wie Pangram selbst bei neurodivergenten Autoren abschneidet, gibt es nicht; die vorliegende Arbeit zu autistischen Schreibmustern (arXiv 2607.14729) hat einen älteren OpenAI-Detektor getestet, nicht Pangram.

Pangram selbst gibt keine Ja/Nein-Antwort aus, sondern einen Wahrscheinlichkeitswert — genutzt wird er in Redaktionen, Prüfungsämtern und sozialen Netzwerken trotzdem als Urteil. Genau darauf zielt Speros Argument im Gespräch mit TechCrunch, KI-Erkennung sei schwerer als die Frage „echt oder gefälscht“: Zwischen einem vollständig generierten Text und einem von Hand überarbeiteten Entwurf liegt ein Kontinuum, für das es keine natürliche Schwelle gibt. Wer eine Zahl in eine Entscheidung übersetzt, setzt diese Schwelle selbst — und haftet für sie.

In derselben Woche warnt Spero im TechCrunch-Podcast, das Netz sei „gefährlich nah“ an der These vom toten Internet. Der Hinweis liegt nahe, dass diese Diagnose vom Anbieter des Gegenmittels stammt; belastbare, unabhängig erhobene Zahlen zum Anteil maschinell erzeugter Inhalte liegen uns dazu nicht vor. Belegt ist immerhin ein akademischer Befund: Eine Auswertung von 186.000 Artikeln aus 1.500 US-Zeitungen fand im Sommer 2025 in über neun Prozent der Texte KI-Anteile.

Für Unternehmen ist die praktische Frage nicht, ob Detektoren funktionieren, sondern wofür man sie einsetzt. Als Signal in einem Prozess — etwa zur Priorisierung, welche Bewerbung oder welcher Beitrag eine menschliche Prüfung bekommt — ist Pangram nach der Studienlage das beste verfügbare Werkzeug. Als Beweismittel gegen eine einzelne Person ist es das nicht, und das ist keine Frage der Genauigkeit, sondern der Grundgesamtheit. Die seit dem 2. August 2026 geltenden Transparenzpflichten aus Artikel 50 des EU-KI-Gesetzes helfen dabei übrigens nicht: Sie verpflichten die Anbieter generativer Systeme, ihre Ausgaben maschinenlesbar zu kennzeichnen — für Modelle, die das nicht tun, und für Inhalte, aus denen die Kennzeichnung entfernt wurde, bleibt nur die nachträgliche Erkennung. Also genau das Verfahren mit der Basisraten-Rechnung.

Reportage

Wenn das Modell aufhört, laut zu denken

Weiterlesen →

Tool-Radar

Neue und trendende KI-Tools des Tages

FrontierHarness Eval Logo
Vergleicht neun Steuerungsgerüste für Coding-Agenten mit ein und demselben Modell und weist Kostenunterschiede bis zum Siebzehnfachen je gelöster Aufgabe nach.
Dreißig Aufgaben, neun Gerüste, zwölf Konfigurationen, 360 Läufe — bewusst mit einem Modell, das keinem der Anbieter gehört, damit niemand Heimvorteil hat. Der Befund kehrt die übliche Beschaffungsfrage um: Nicht das Modell entscheidet über die Rechnung, sondern die Schicht darum herum. Hinter dem Test steht das Startup Runta.
Daten & Evaluation · September 2026
Talos Logo
KI-Agent mit einer vorgelagerten Rechteschicht, die jeden Werkzeugaufruf einzeln gegen ein Manifest prüft, statt dem Modell zu vertrauen.
Jede Aktion ist an ihre genauen Argumente gebunden, gilt nur einmal und nur 30 Sekunden lang; Werkzeuge müssen ihre Wirkung vorher deklarieren, geraten kann das Modell nichts. Das ist der Gegenentwurf zu Leitplanken, die erst nachträglich prüfen — und liest sich wie eine direkte Antwort auf die Git-Lücke in unserem vierten Artikel. Ein Entwicklername ist auf der Seite nicht ausgewiesen.
Dev-Tools & Sicherheit · August 2026
Dial Logo
Gibt einem KI-Agenten über eine einzige Schnittstelle eine echte Telefonnummer samt SMS, WhatsApp und Sprachanrufen.
Nummernvergabe, Zwei-Wege-SMS, WhatsApp in über 180 Ländern und Anrufe mit Live-Transkription liegen hinter einem REST-Endpunkt oder einem MCP-Server, statt bei einem halben Dutzend Anbietern zusammengesucht zu werden. Startup aus San Francisco; Gründungsnamen sind nicht öffentlich ausgewiesen.
Agent-Infrastruktur · September 2026
Doop Logo
Quelloffene Design-Leinwand, auf der Menschen und KI-Agenten gleichzeitig an denselben HTML-Entwürfen arbeiten.
Agenten greifen über einen eingebauten MCP-Server direkt auf die Leinwand zu, auf der auch die Menschen arbeiten; Cursor, Rahmenänderungen und Agentenstatus sind live sichtbar, statt dass man promptet und neu lädt. Entwickelt von Kevin Goedecke im Alleingang, das Repository ist seit dem 22. August öffentlich.
Kreativ & Design · September 2026
deepeye Logo
Browsererweiterung, die KI-generierte und manipulierte Bilder, Videos und synthetische Selfies direkt beim Surfen markiert.
Der eigentliche Unterschied ist nicht die Erkennung, sondern der Beleg: Jeder Befund wird kryptografisch signiert und lässt sich unabhängig nachprüfen — genau die Eigenschaft, die den in unserem achten Artikel beschriebenen Detektoren fehlt. Neue Produktlinie des Identitätsprüfungs-Startups deepidv aus San Francisco.
Erkennung & Nachweis · September 2026
Userlens Logo
Lässt Agenten Nutzungsverhalten, Stimmung in Support-Kanälen und offene Tickets je Kunde fortlaufend auswerten, um Kündigungen früh zu erkennen.
Statt eines Dashboards, in das jemand hineinsehen müsste, läuft ein Agent mit und übersetzt Produktdaten in konkrete Handlungsimpulse für das Kundenteam. Y-Combinator-Startup von Ankur Dahama und Hai Ta; die genannten Wachstumszahlen stammen vom Anbieter selbst. Nicht zu verwechseln mit dem gleichnamigen Produkt auf userlens.ca.
Business & Analytics · September 2026

Aus der Werkstatt

YouTube-Empfehlungen: Tutorials, Erklärungen und Werkzeuge

OpenAI Astra and Recurrent Depth / Looped Transformers
Tutorial
Sebastian Raschka · 28:03
Die technische Ergänzung zu unserem zweiten Artikel: Raschka erklärt, was rekursive Tiefe und Looped Transformers architektonisch bedeuten, und ordnet das Verfahren zwischen Universal Transformers, Mixture-of-Recursions und aktuellen Modellen ein. Behandelt werden auch die praktischen Folgen für den KV-Cache und die Frage, ob man solche Modelle von Grund auf trainieren muss oder bestehende umbauen kann. Kein Sponsoring, Fachliteratur ist im Beschreibungstext verlinkt.
Fable 5.1 Just Built a Better Claude Code for Local Models
Tutorial
Leon van Zyl · 11:16
Ausgangspunkt ist eine konkrete Zahl: Claude Code belegt rund 37.000 Token, bevor die erste Eingabe kommt — bei einem lokalen Modell mit 64.000 Token Kontext ist damit mehr als die Hälfte weg. Van Zyl lässt Fable 5.1 daraufhin ein schlankes eigenes Gerüst für Ollama und LM Studio bauen und zeigt den ganzen Weg von der Anforderung bis zur Veröffentlichung als npm-Paket, inklusive der Stellen, an denen das Modell dem Entwurf widerspricht. Offenlegung: Der Kanal bewirbt im Beschreibungstext eigene kostenpflichtige Kurse.