· 6 Artikel + Reportage + Tool-Radar + Werkstatt

Ausgabe vom 21. September 2026

Maschinell recherchiert, menschlich relevant.

KI und Militär · Zielauswahl

Der UN-Bericht nennt keine Software — und genau darin liegt die Nachricht

Hintergrund & Analyse

Am 18. September 2026 hat die Unabhängige Internationale Untersuchungsmission zur Islamischen Republik Iran ihren Bericht an den UN-Menschenrechtsrat übermittelt. Er trägt das Aktenzeichen A/HRC/63/61 und behandelt auf achtzehn Seiten unter anderem einen Luftangriff, der am 28. Februar 2026 zwischen etwa 10.30 und 11.30 Uhr Ortszeit die Shajareh-Tayyebeh-Grundschule in Minab in der Provinz Hormozgan traf. Wir haben das Dokument heruntergeladen und vollständig gelesen.

Zuerst die Feststellungen des Berichts selbst. Der Staatsanwalt von Minab, Ebrahim Taheri, gab die Zahl der Toten am 9. April 2026 mit 156 an: 120 Schulkinder, davon 73 Jungen und 47 Mädchen, dazu 26 Lehrkräfte — allesamt Frauen —, sieben Elternteile, ein Schulbusfahrer und ein Techniker aus einer nahegelegenen Apotheke. Eine von der Mission als glaubwürdig eingestufte unabhängige Quelle nennt 157 Tote, darunter 123 Kinder im Alter von höchstens dreizehn Jahren, fünfzehn davon sechsjährig. Der Rote Halbmond meldete rund 110 Verletzte. Als Waffe identifiziert die Mission anhand von Wrackteilen zwei Marschflugkörper vom Typ Tomahawk.

Die Schule lag unmittelbar neben einer Marineanlage der Revolutionsgarden — das nächste Gebäude war rund 72 Meter entfernt. Entscheidend ist, was die Mission zur baulichen Lage feststellt: Zwischen 2013 und 2016 war eine Mauer errichtet worden, die das Schulgelände vom Militärkomplex trennte, mit eigenem Zugang. Der zivile Charakter war von außen erkennbar, und zwar vor dem Angriff: Schulhof, Wandmalereien, ein Fußballplatz.

Die rechtliche Einordnung fällt deutlich aus. Die Mission kommt in Absatz 125 zu dem Schluss, die Vereinigten Staaten hätten „wilfully“ gehandelt, also mit bedingtem Vorsatz. Der Wortlaut nennt als Gründe unter anderem „the apparent existence of and reliance on outdated targeting data“ und die zahlreichen Merkmale, die das Gebäude als Bildungseinrichtung für kleine Kinder auswiesen. Das Versäumnis, die Angaben in den Zieldatenbanken zu aktualisieren, sei „beyond mere negligence“ gegangen. In Absatz 126 folgt der Befund: Es bestünden „reasonable grounds to believe that the United States committed the war crime of launching an indiscriminate attack“. Absatz 124 formuliert den Kernsatz, auf den es hier ankommt: „Updating targeting information and acting upon such information falls within the category of feasible precautions an attacking party is required to take under international humanitarian law.“ Die Pflege der Datenbank ist demnach eine völkerrechtliche Pflicht.

Nun zu dem, was im Bericht nicht steht. Der deutsche Aufgriff bei heise trägt den Zusatz, Palantir rücke „erneut in den Fokus“. Wir haben den Volltext des Berichts — gut 10.000 Wörter — daraufhin durchsucht: Das Wort „Palantir“ kommt kein einziges Mal vor. „Maven“ kommt kein einziges Mal vor. Und auch die Wortfolge „artificial intelligence“ steht nirgends im Dokument. Die Mission spricht ausschließlich von „targeting databases“ und „outdated intelligence“ und stützt sich dabei auf zwei Fußnoten, die auf Berichte der New York Times vom 11. März und von Reuters vom 13. März 2026 verweisen. Wer den UN-Bericht als Beleg dafür zitiert, eine KI habe das Ziel ausgewählt, zitiert etwas, das dort nicht steht.

Die Softwarespur stammt aus einer zweiten, zeitlich fast deckungsgleichen Veröffentlichung. Bloomberg hat am Freitag, dem 18. September, eine Recherche zur Ereigniskette des Angriffs publiziert; Gizmodo hat sie am Samstag, dem 20. September, 5:00 Uhr Ostküstenzeit, ausgewertet — Autor Kyle Torpey, Datum am Seitenquelltext geprüft. Danach berufen sich die Bloomberg-Autoren auf Beamte, die mit einer unveröffentlichten internen Prüfung des Pentagons befasst waren. Deren Darstellung: Teile des Personals im US-Zentralkommando hätten sich zu stark auf die KI im Maven Smart System verlassen. Die Anlage in Minab sei wegen veralteter Daten als Einrichtung der Revolutionsgarden geführt, zusammen mit anderen Kandidaten in Maven eingespeist worden und als empfohlenes Ziel für den ersten Kriegstag wieder herausgekommen. Arbeit an Ziellisten, die früher Stunden gedauert habe, sei auf Minuten verdichtet worden. Bemerkenswert ist ein Detail, das Gizmodo wiedergibt: Einige Nutzer hätten erwartet, Maven werde veraltete Datensätze oder Widersprüche von sich aus kennzeichnen — warum sie das erwarteten, sei nicht erkennbar.

Palantir teilte Bloomberg über einen Sprecher mit, das Unternehmen sei „not responsible for the underlying data nor identifying intelligence deficiencies“; es gebe keinen Beleg, dass die Software fehlerhaft gewesen sei. Nach dem Angriff habe Palantir Funktionen ergänzt, die zugrundeliegende Aufklärungsdaten erneut prüfen, um Ausschlusskriterien und Widersprüche zu finden. Den Bloomberg-Originaltext konnten wir nicht selbst öffnen; wir geben ihn deshalb ausdrücklich in der Belegkette über Gizmodo wieder, dessen Seite wir im Volltext gelesen haben.

Für Leser dieses Magazins ist eine weitere Ebene interessant, die in der Tagesberichterstattung untergeht. Das Maven Smart System ist nicht nur Palantir. In einer Analyse des Center for Strategic and International Studies, verfasst von Gregory C. Allen und veröffentlicht am 2. Juni 2026, heißt es über die Sprachmodell-Schicht der Plattform: „Anthropic was the first frontier AI company to deploy its models in those environments and has powered MSS's LLM capabilities to date.“ Palantir sei „the prime software integrator for MSS“; aus unveröffentlichter, von CSIS eingesehener Dokumentation zitiert die Analyse den Satz „MSS is powered by the Palantir Platform“. Die Verbindung geht auf eine im November 2024 angekündigte Partnerschaft zurück, über die Claude auf Verschlusssachennetze kam.

Diese Konstellation stand nach derselben CSIS-Analyse schon im Juni unter erheblichem Druck, und zwar aus einem Grund, der hierhergehört: Anthropic weigerte sich bei der Neuverhandlung des Vertrags, eine Klausel für „any lawful use“ aufzunehmen und jene Nutzungsbedingungen zu streichen, die den Einsatz von Claude für flächendeckende Inlandsüberwachung und vollautonome Waffen untersagen. Das Pentagon stufte Anthropic daraufhin als „Supply Chain Risk“ ein.

An dieser Stelle ist die CSIS-Analyse vom Juni allerdings überholt, und wir korrigieren sie anhand unserer eigenen früheren Berichterstattung: Die Einstufung hatte vor Gericht keinen Bestand. Richterin Rita F. Lin vom Bundesbezirksgericht für Nordkalifornien blockierte sie bereits im März 2026 und bezeichnete das Vorgehen als Vergeltung für eine Meinungsäußerung. Bei der Anhörung über die wechselseitigen Anträge auf Sachentscheidung Ende Juli, über die wir in unserer Ausgabe vom 31. Juli berichtet haben, sagte sie der Regierung, die Aktenlage sei für sie eher schlechter geworden. Wer den Maven-Komplex heute einordnet, sollte das mitlesen: Der Ausschluss des Anbieters, dessen Modell die Sprachfunktionen der Plattform trug, ist juristisch umstritten und nicht abgeschlossen.

Ob das konkrete Modell im Februar 2026 an der Zielliste für Minab beteiligt war, ist mit all dem nicht gesagt — und wir behaupten es auch nicht.

Was bleibt, ist eine unangenehm saubere Trennlinie. Die UN stellt einen Sachverhalt fest, der ohne jede Technologie auskommt: Eine Datenbank war falsch, niemand hat sie korrigiert, das Völkerrecht verlangt die Korrektur. Die Frage, welche Rolle eine Software bei der Auswahl spielte, liegt in einem Bericht, den die Öffentlichkeit nicht lesen darf, und wird von Beamten erzählt, die nicht genannt werden. Mehr als 120 Abgeordnete der Demokraten hatten im März Verteidigungsminister Pete Hegseth schriftlich gefragt, welche Rolle Maven und andere KI-Werkzeuge bei der Identifizierung des Ortes gespielt hätten. Eine öffentliche Antwort steht laut Gizmodo bis heute aus, unter Verweis auf die laufende Untersuchung. Die Mission selbst hatte am 16. und 24. Juni um Auskunft und um Gespräche mit dem Kommandeur des Zentralkommandos gebeten. Bis zur Fertigstellung des Berichts hatte sie keine Antwort erhalten.

Das Weiße Haus hat den Bericht als Ganzes zurückgewiesen. Anna Kelly, Principal Deputy Press Secretary, erklärte: „The UN Human Rights Council has accomplished nothing for human rights while spouting unserious nonsense for decades.“ Die einzige Partei in diesem Konflikt, die Kriegsverbrechen begangen habe, sei das iranische Regime. Eine Reaktion der iranischen Regierung speziell auf dieses Dokument konnten wir nicht auffinden — wir sagen das als Befund, nicht als Recherchelücke, die sich noch schließen ließe.

KI-Politik · Washington

Eine Woche nachdem das FBI Alibaba Modellklau vorwarf, durchsuchte das US-Amtsblatt seine Dokumente mit Qwen

Hintergrund & Analyse

Die Reuters-Korrespondentin Courtney Rozen meldete am Donnerstag, dem 17. September 2026, einen Vorgang, der für sich genommen klein wirkt und in der Zusammenschau bemerkenswert ist: Die Website des Federal Register — des amtlichen Verkündungsblatts der Vereinigten Staaten, betrieben vom Office of the Federal Register der Nationalarchive gemeinsam mit dem Government Publishing Office — bot ihren Nutzern eine Dokumentensuche an, die auf einem KI-Modell von Alibaba beruhte.

Der Zeitpunkt ist der Kern der Geschichte. Eine Woche zuvor, um den 8. September, hatten FBI, NSA und CISA in einer gemeinsamen Mitteilung sechs chinesischen KI-Unternehmen vorgeworfen, US-Technologie in „industriellem Maßstab“ und auf „bösartige“ Weise zu kopieren; Alibaba gehörte zu den Genannten, und der Vorwurf lautete konkret, Anthropics Modelle nachgebaut zu haben. Reuters formuliert den Widerspruch in der Überschrift: Eine Regierungswebsite nutzte ein Suchwerkzeug aus China, von dem das FBI gesagt hatte, es kopiere Anthropic.

Was genau lief dort? Das Fachportal OfficeChai hat die Seite vor und nach der Abschaltung verglichen: Wo vorher fünf Suchmodi zur Wahl standen, sind es jetzt zwei. Im Auswahlmenü der erweiterten Dokumentensuche neben den Modi „Semantic“ und „Keyword Only“ ein Modus namens „Neural“, der auf dem Sentence-Transformers-Modell msmarco-distilbert-base beruhte, sowie zwei Varianten auf Basis von Qwen3:0.6B — eines sehr kleinen Modells mit 600 Millionen Parametern. Eine der beiden war als „hybrid“ mit dem Zusatz „512D, Recursive Splitting, Distilled, Prefixed“ beschriftet, also eine Einbettungskonfiguration. Es ging demnach nicht um einen Chatbot und nicht um Zusammenfassungen, sondern um semantische Suche: Das Modell wandelt Texte in Zahlenvektoren um, damit die Suche inhaltlich ähnliche Dokumente findet und nicht nur wörtliche Treffer.

Reuters schreibt ausdrücklich, es sei unklar geblieben, wann die Funktion in Betrieb genommen wurde. Abgeschaltet wurde sie am Mittwoch, dem 16. September, etwa zur selben Zeit, als die ersten Beiträge in sozialen Netzwerken erschienen. Als Belege nennt Reuters Bildschirmfotos und eine archivierte Fassung des Seitenquelltextes.

Die entscheidende technische Frage ist bis heute unbeantwortet. Qwen ist ein Modell mit offenen Gewichten. Reuters weist selbst darauf hin, was das bedeutet: Entwickler können es herunterladen, anpassen und auf eigener Infrastruktur betreiben, oft zu geringeren Kosten als bei geschlossenen Modellen von Anthropic oder OpenAI — und Sicherheitsfachleute betonen, dass gerade das die Kontrolle über sensible Daten erhöht, statt sie zu verringern. Ob die Behörde das Modell also lokal laufen ließ oder Anfragen an Server von Alibaba schickte, ist der Unterschied zwischen einer Petitesse und einem Vorfall — und genau diese Frage beantwortet keine der uns vorliegenden Quellen. Sie ist die einzige, auf die es sicherheitstechnisch ankommt, und sie wurde öffentlich nicht gestellt. Die Nationalarchive haben sich ohnehin nicht geäußert; FBI, Nationalarchive und Weißes Haus reagierten nach Angaben von Reuters nicht oder lehnten eine Stellungnahme ab.

Die Reaktionen fielen entsprechend unterschiedlich aus. Daniel Castro, Präsident der Information Technology and Innovation Foundation, sagte Reuters: „It's one of the most insane things I've ever seen.“ Der Republikaner John Moolenaar, Vorsitzender des China-Ausschusses des Repräsentantenhauses, erklärte: „No federal government entity should use a Chinese AI model. Doing so only makes the federal government more dependent on Chinese AI models and that is not in the national interest.“ Anupam Chander, Juraprofessor an der Georgetown University, hielt dagegen: Ein unmittelbares Sicherheitsrisiko sei nicht erkennbar — die durchsuchten Dokumente sind ohnehin veröffentlichte Bundesverordnungen. Ein Sprecher der chinesischen Botschaft in Washington nannte die Kopiervorwürfe „unfounded“.

Und die Rechtslage? Wir haben geprüft, welche Vorschrift hier gegriffen hätte, und die Antwort ähnelt der aus anderen Fällen dieser Wochen: keine. Abschnitt 1532 des Verteidigungshaushaltsgesetzes für das Haushaltsjahr 2026, in Kraft seit dem 17. Januar 2026, untersagt zwar die Nutzung von KI-Produkten jener chinesischen Unternehmen, die auf der Liste nach Abschnitt 1260H stehen — und Alibaba Group Holding wurde am 8. Juni 2026 dort aufgenommen. Die Vorschrift gilt aber ausdrücklich nur für Auftragnehmer während der Ausführung eines Vertrags des Verteidigungsressorts, nicht für Nationalarchive und Verlagsamt. Die kursierenden Gesetzentwürfe, die ein breiteres Verbot vorsehen, sind Entwürfe geblieben. Die Verbote einzelner Behörden richten sich gegen DeepSeek auf Dienstgeräten, nicht gegen Qwen im Backend einer Zivilbehörde.

Der deutsche Aufgriff bei t3n stellt die Sache unter die Überschrift, US-Modelle seien zu teuer gewesen. Das ist eine Deutung, kein Befund: Eine Aussage der Behörde zu ihren Beweggründen existiert nicht, und der Preisvergleich, auf den sich diese Lesart stützt, betrifft große Chat-Modelle, nicht ein 600-Millionen-Parameter-Einbettungsmodell, das man üblicherweise ohnehin selbst betreibt. Naheliegender als der Preis ist die schlichte Verfügbarkeit: Wer eine semantische Suche baut, greift zu dem kleinen Modell, das auf den einschlägigen Bestenlisten oben steht — und das ist seit geraumer Zeit häufig eines aus China.

Arbeitsmarkt · Berufseinstieg

Dreizehn Prozent weniger im ersten Job — und es trifft ausgerechnet die Informatiker

Hintergrund & Analyse

Unter der Nummer CES 26-56 hat das Center for Economic Studies des US Census Bureau im September 2026 ein Arbeitspapier veröffentlicht, das die Debatte über KI und Berufseinstieg auf eine ungewöhnlich breite Datengrundlage stellt. Titel: „Graduating into Disruption: Labor Market Outcomes for AI-Exposed College Majors“, verfasst von Cody Orr, Lee C. Tucker und Lawrence Warren. Wir haben das PDF heruntergeladen und die Kernpassagen am Originaltext geprüft.

Die Zahl zuerst, dann ihre Bedeutung. Im Abstract heißt es: „the most AI-exposed decile of college majors saw their likelihood of initial employment decline by five percentage points, while full-quarter initial earnings declined by thirteen percent.“ Wichtig ist, womit verglichen wird — und das ist nicht das, was die Schlagzeile nahelegt. Verglichen wird nicht dasselbe Fach vor und nach dem KI-Boom und auch nicht mit dem Arbeitsmarkt insgesamt, sondern das oberste Zehntel der KI-exponierten Studienfächer mit den untersten sechs Zehnteln, gemessen als Veränderung seit der Veröffentlichung von ChatGPT Ende 2022. Gemessen wird außerdem das Quartalseinkommen bei durchgehender Beschäftigung im vollen Quartal, nicht der Stundenlohn und nicht das Jahresgehalt. Nach zwei Jahren schrumpft der Abstand auf etwa fünf Prozent.

Der eigentliche Befund steht ein paar Zeilen später und fehlt in fast allen Aufgriffen. Die Autoren schreiben, die negativen Veränderungen konzentrierten sich auf das oberste Zehntel der Fächer, „which are composed largely of computer science, information systems, and other degree fields closely related to software development“. Es sind also nicht die klassischen Verdachtskandidaten der Automatisierungsdebatte — nicht Verwaltung, nicht Journalismus, nicht Übersetzung —, sondern jene Fächer, die man jahrzehntelang als sichersten Weg in einen gut bezahlten Job empfohlen hat. Ein deutscher Aufgriff listet Journalismus unter den Betroffenen; im Papier dient dieses Fach lediglich als erfundenes Rechenbeispiel, und in der zugehörigen Abbildung liegt Kommunikationswissenschaft im wenig exponierten Bereich mit positiver Beschäftigungsentwicklung.

Zur Datengrundlage. Ausgewertet wurden 6.665.500 Abschlussdatensätze, rund 29 Prozent aller zwischen 2016 und 2024 in den USA verliehenen Bachelor-Abschlüsse. Sie stammen aus dem Programm „Post-Secondary Employment Outcomes“, das Abschluss- und Leistungsdaten von über 350 Hochschulen in 24 Bundesstaaten enthält, und werden mit den LEHD-Daten verknüpft — Lohndaten aus der Arbeitslosenversicherung, die in den beteiligten Staaten über 95 Prozent aller Arbeitsverhältnisse abdecken. Das KI-Expositionsmaß stammt aus einer aufgabenbasierten Bewertung von Eloundou und Kollegen und wird über die Berufsverteilung junger Absolventen auf die Studienfächer übertragen. Das Design ist eine Ereignisstudie mit Fixed Effects auf Hochschul-, Fach- und Quartalsebene.

Wie belastbar ist das? Zwei Einschränkungen gehören an diese Stelle und nicht ans Ende. Erstens handelt es sich um ein Arbeitspapier, das ausdrücklich kein Begutachtungsverfahren durchlaufen hat; im Deckblatt steht der Standardsatz, die Papiere hätten „not undergone the review accorded Census Bureau publications“. Zweitens erheben die Autoren zwar einen kausalen Anspruch, benennen dessen Voraussetzungen aber selbst und räumen ein: „our design cannot rule out other time-varying shocks to particular fields that coincide with the diffusion of generative AI.“ Und weiter: „The short post-ChatGPT period also limits what we can say about persistence.“ Wer das Papier als Beweis liest, liest es falsch; wer es als bislang breiteste Messung liest, liest es richtig.

Woher kommt der Einkommensabstand? Hier liegt der praktisch interessanteste Teil. Etwa die Hälfte des Rückgangs entsteht innerhalb derselben Branchen — dieselbe Art Arbeitgeber zahlt weniger. Die andere Hälfte entsteht durch eine Verschiebung der Branchenzusammensetzung: weg von Information sowie freiberuflichen, wissenschaftlichen und technischen Dienstleistungen, hin zu niedriger entlohnten Bereichen wie Einzelhandel und Gastronomie. Das ist ein anderer Mechanismus als „es gibt keine Stellen mehr“. Die Beschäftigungsquote der Absolventen bleibt insgesamt hoch; was sich ändert, ist die Qualität des ersten Arbeitsverhältnisses.

Die Autoren ordnen die Größenordnung selbst ein: Ihr Rückgang sei größer als die neun bis zehn Prozent Einkommensverlust, die die Forschung für den Berufseinstieg in einer schweren Rezession findet — allerdings mit dem Hinweis, dass ihre Quartalsmessung nicht unmittelbar mit Jahresverdienststudien vergleichbar sei. Eine Untersuchung des Stanford Digital Economy Lab um Erik Brynjolfsson weist in dieselbe Richtung und findet bei 22- bis 25-Jährigen in stark exponierten Berufen eine deutlich niedrigere Beschäftigung. Gegenläufig argumentiert das Yale Budget Lab, das gesamtwirtschaftlich keine klare KI-bedingte Verwerfung erkennt — was kein Widerspruch sein muss, weil dort der ganze Arbeitsmarkt betrachtet wird und hier die Eintrittstür.

Für Deutschland und Europa existiert nach unserer Recherche keine vergleichbare Untersuchung. Das ist keine Nebenbemerkung: Der deutsche Berufseinstieg läuft über andere Institutionen — duale Ausbildung, Tarifbindung, andere Kündigungsfristen —, und ob sich derselbe Effekt hier überhaupt zeigen würde, ist eine offene empirische Frage und keine, die man aus US-Daten beantworten kann.

Forschung · Bildverstehen

Zweihundert Bildmodelle, ein Umriss — und kein einziges erkennt, was jeder Mensch sofort sieht

Hintergrund & Analyse

Am 17. September 2026 ist im Fachjournal iScience eine Arbeit erschienen, die eine alte Frage der Bildverarbeitung mit ungewöhnlicher Systematik beantwortet: Sehen künstliche neuronale Netze Objekte an denselben Merkmalen wie Menschen? Die Antwort lautet nein, und sie fällt deutlicher aus als erwartet. Verfasst haben die Studie Mugihiko Kato und Biyu J. He von der NYU Grossman School of Medicine; wir haben Titel, Autorenschaft, Journal und Datum über die Crossref-Datenbank am DOI 10.1016/j.isci.2026.117370 gegengeprüft und den Preprint auf bioRxiv aufgerufen, der seit dem 6. August verfügbar ist.

Der methodische Einfall. Bisherige Arbeiten zu diesem Thema — bekannt ist vor allem die Untersuchung von Geirhos und Kollegen aus dem Jahr 2018, die Bildmodellen eine Vorliebe für Textur statt Form nachwies — haben Merkmale gegeneinander ausgespielt: Man klebt das Fell eines Elefanten auf die Silhouette einer Katze und schaut, wofür sich das Modell entscheidet. Das hat einen Haken: Ein hoher Wert für „Formorientierung“ kann auch bloß bedeuten, dass ein Modell schlecht mit Texturen umgeht. Kato und He haben die Merkmale stattdessen einzeln isoliert. Aus 240 Bildern des ImageNet-Datensatzes, verteilt auf 48 Kategorien, erzeugten sie sechs Varianten, in denen jeweils nur die globale Form, nur die Textur oder nur die inneren Strukturlinien übrig blieben.

Die menschlichen Referenzwerte stammen von 60 Testpersonen. Sie erkannten Bilder, in denen Textur und Binnenstruktur erhalten waren, zu 70,8 Prozent korrekt; bei reinen Silhouetten immerhin zu 58,4 Prozent; bei reiner Textur nur zu 18,4 Prozent und bei reinen Binnenlinien zu 26,9 Prozent. Der Umriss allein trägt also beim Menschen erstaunlich weit — er ist nach der Vollansicht das zweitstärkste Einzelmerkmal.

Getestet wurden mehr als 200 Modelle aus der Brain-Score-Datenbank, darunter im Detail ResNet50, ConvNeXt-Large, das rekurrente CORnet-S und Vision Transformer, dazu Varianten mit Weichzeichner- und Stiltraining sowie CLIP-Modelle in Zero-Shot- und nachtrainierter Form; ergänzend ein Klassifikator auf Basis von Stable Diffusion. Das Abstract fasst zusammen: „No DNNs replicated humans' cue-reliance profile, including those with recurrence or specialized training.“ Die nachtrainierten Text-Bild-Modelle kamen dem menschlichen Muster insgesamt am nächsten — verloren diese Ähnlichkeit aber genau dann, wenn die globale Form gestört wurde. Und der zentrale Satz: „all DNNs substantially underperformed humans when the global shape cue alone was critical to object recognition.“

Im zweiten Experiment wird es drastisch. Dort setzten die Forscher Silhouetten aus kleinen Kreuzsymbolen zusammen, in dünner und in dichter Streuung — damit ist die lokale Bildinformation vollständig von der globalen Form entkoppelt. Für Menschen bleibt die Figur erkennbar, so wie man einen aus Leuchtpunkten geformten Schriftzug liest. Kein Modell erreichte hier menschliches Niveau; Modelle ohne CLIP-Training landeten teilweise bei null Prozent. Der Stable-Diffusion-Klassifikator kam auf 1,41 Prozent in der dünnen und 12,7 Prozent in der dichten Variante.

Aufschlussreich ist weniger die Fehlerquote als die Art der Fehler. Im Papier heißt es: „Most predictions were confined to a small number of classes featuring cross-like patterns, such as 'crossword puzzle,' 'jigsaw puzzle,' or 'window screen'. For example, inConvNeXt labeled 95% of Sparse images as 'crossword puzzle,' and even CLIP models often predicted 'chain mail,' 'window screen,' or 'nematode'.“ Die Modelle sehen also nicht etwa das falsche Tier — sie sehen überhaupt kein Objekt, sondern das Muster der Bausteine, aus denen die Figur besteht. Sie lesen die Punkte und nicht den Schriftzug. Das deutsche Schlagwort vom „Kettenhemd statt Katze“ trifft den Befund im Kern; die wörtliche Zuordnung dieses Fehlers zu einem Katzenbild steht allerdings in einer Tabelle, die wir nicht einsehen konnten, weshalb wir die Zuspitzung hier als Zuspitzung kennzeichnen.

Was folgt daraus für die Praxis? Hier ist Zurückhaltung geboten, und wir halten uns daran: Weder das Papier noch die Pressemitteilung der NYU sprechen über Qualitätskontrolle, Medizintechnik oder autonomes Fahren. Biyu He wird mit dem Satz zitiert, gegenwärtige Modelle leisteten visuelle Objektwahrnehmung nicht auf dieselbe Weise wie Menschen — „despite being trained on a massive number of pictures“. Der als Anwendungsbezug genannte Bereich sind Assistenzsysteme und Gehirn-Computer-Schnittstellen.

Was sich dennoch seriös sagen lässt: Die Arbeit zeigt, dass Trefferquoten auf gewöhnlichen Fotodatensätzen wenig darüber aussagen, worauf ein Modell tatsächlich reagiert. Wer ein Bildmodell in einem Bereich einsetzt, in dem Eingaben systematisch anders aussehen als natürliche Fotos — technische Zeichnungen, Schaltpläne, Umrissdarstellungen, Radar- oder Ultraschallbilder —, sollte nicht davon ausgehen, dass eine hohe ImageNet-Genauigkeit sich überträgt. Kritik, Replikationen oder Gegenrede zu dieser Arbeit gibt es bislang nicht; bei einer vier Tage alten Veröffentlichung wäre alles andere überraschend.

Robotik · Produktion

Toyota beziffert seine Roboterpläne auf eine Billion Yen im Jahr — und nimmt das Wort „humanoid“ wieder zurück

Hintergrund & Analyse

Toyota hat auf einer Investorenveranstaltung von Toyota Motor Europe in Brüssel am 18. September 2026 Zahlen zur Automatisierung seiner Fertigung vorgelegt. Die Nachrichtenlage dazu ist besser, als der deutsche Aufgriff vermuten lässt: Die t3n-Formulierung, Toyota „soll planen“, liest sich wie ein Hinweis auf anonyme Quellen. Tatsächlich stammen die Angaben aus einer Präsentation vor Investoren, über die CNBC, Reuters und Nikkei am selben Tag berichteten.

Die Zahlen. Nach dem CNBC-Bericht, dessen Veröffentlichungszeitstempel wir am Seitenquelltext geprüft haben, schätzt Toyota die Kosten der Werksmodernisierung ab 2028 auf rund eine Billion Yen jährlich, umgerechnet etwa 6,4 Milliarden US-Dollar. Der Betrag umfasst Toyota selbst, die Konzerngesellschaften und die großen Zulieferer. Für die Automatisierung dieser Werke — die Rede ist von rund 60 Standorten — seien nach Unternehmensangaben gegenüber Investoren etwa 400.000 Roboter nötig.

Und nun die drei Einschränkungen, die in die Mitte des Textes gehören und nicht ans Ende. Erstens schreibt CNBC ausdrücklich, Toyota habe nicht angegeben, ob es definitiv dazu kommen werde und über wie viele Jahre die Investition liefe: „Without specifying whether it would definitely take place or for how many years it would continue“. Eine jährliche Summe ohne Laufzeit ist keine Investitionsentscheidung, sondern eine Rechengröße.

Zweitens, und das ist die folgenreichste Korrektur: „The figure includes replacements for existing machines and new installations and humanoid and non-humanoid robots.“ Die 400.000 sind also nicht 400.000 neue Maschinen und erst recht nicht 400.000 Humanoide. Enthalten sind der Ersatz vorhandener Anlagen und ganz gewöhnliche Industrieroboter. Wer die Zahl als Ankündigung einer humanoiden Belegschaft liest, liest sie falsch.

Drittens lässt sich diese Korrektur an der Berichterstattung selbst beobachten. Die Adresse des Nikkei-Asia-Artikels enthält bis heute die Zeichenfolge toyota-to-deploy-400-000-humanoid-robots; die Überschrift auf der Seite lautet inzwischen „Toyota to deploy 400,000 robots to work alongside factory staff“. Das Wort „humanoid“ ist aus dem Titel verschwunden und in der URL steckengeblieben — ein kleiner, aber sprechender Beleg dafür, wie die Zahl in den ersten Stunden gerahmt wurde.

Was hinter der Sache technisch steckt — und wo unsere Belege enden. In der japanischen Berichterstattung kursieren Angaben zu einem eigenentwickelten Toyota-Roboter samt Name, Gewicht, Greifhand und einem Anlernverfahren, bei dem Werksmitarbeiter die Bewegung vormachen. Wir geben diese Angaben hier nicht wieder: Der Nikkei-Text steht hinter einer Bezahlschranke, und eine eigene Mitteilung von Toyota zu dieser Ankündigung haben wir nicht gefunden. Was wir belegen können, ist die Forschungslinie, in der das steht.

Toyota arbeitet seit Jahren an sogenannten Large Behavior Models. Die Idee lässt sich in einem Satz sagen: Statt jeden Handgriff einzeln zu programmieren, trainiert man ein Modell auf großen Mengen von Bewegungsdaten, aus denen es mehrere Aufgaben ableiten kann — das Gegenstück zum Sprachmodell, nur für Bewegung statt für Text. Wie weit das trägt, hat das Toyota Research Institute am 20. August 2025 gemeinsam mit Boston Dynamics gezeigt: Dort steuerte ein solches Modell den Humanoiden Atlas durch eine lange, zusammenhängende Folge von Aufgaben, die Greifen und Gehen verbinden. Die gemeinsame Mitteilung formuliert den eigentlichen Reiz so: Fähigkeiten, die zuvor mühsam von Hand programmiert werden mussten, ließen sich nun hinzufügen, indem man dem Modell Daten gibt. Ob die Roboter, über die Toyota jetzt mit Investoren gesprochen hat, auf dieser Technik beruhen, geht aus den uns zugänglichen Quellen allerdings nicht hervor.

Zur Einordnung der Größenordnung. Nach der Statistik World Robotics 2025 der International Federation of Robotics wurden im Jahr 2024 weltweit rund 542.000 Industrieroboter neu installiert, über alle Branchen und Hersteller hinweg — das vierte Jahr in Folge über einer halben Million. Toyotas 400.000 sind also, über einen unbestimmten Zeitraum verteilt, eine sehr große Zahl, aber keine, die jede Vorstellung sprengt: Sie entspricht etwa dem, was weltweit in neun Monaten aufgestellt wird. Belastbare Bestandszahlen einzelner Wettbewerber ließen sich nicht finden; die IFR veröffentlicht Länder- und Branchenwerte, keine Herstellerbestände.

Bleibt die Frage, was Toyota mit der Zahl eigentlich sagen wollte. Eine eigene Pressemitteilung des Konzerns zu dieser Ankündigung haben wir nicht gefunden; alles stützt sich auf die Präsentation vor Investoren und die Berichterstattung darüber. Für eine Ankündigung dieser Größenordnung ist das bemerkenswert wenig — und es passt zu dem, was CNBC über die fehlende Laufzeitangabe schreibt. Wer 400.000 Roboter plant, nennt üblicherweise ein Jahr, bis wann. Wer eine Rechengröße in einen Investorenausblick schreibt, tut das nicht.

Agenten in der Praxis · Einzelhandel

Seit 163 Tagen führt ein Sprachmodell einen Laden in San Francisco — und der Angestellte beschreibt es anders als die Schlagzeilen

Hintergrund & Analyse

An der 2102 Union Street im Stadtteil Cow Hollow in San Francisco steht ein Geschäft namens Andon Market, das seit dem 10. April 2026 von einem KI-Agenten geführt wird. Betrieben wird es von Andon Labs, einem 2023 gegründeten Unternehmen für KI-Sicherheitsprüfungen der Mitgründer Axel Backlund und Lukas Petersson. Auf der Projektseite des Unternehmens steht der Anspruch in einem Satz: „Luna, an AI agent powered by Claude Fable 5.1, runs the business end-to-end.“ Ein Zähler auf derselben Seite gab beim Abruf für diesen Artikel an, der Laden sei seit 163 Tagen geöffnet.

Was der Agent tatsächlich entscheidet. Nach der Darstellung von Andon Labs wählt Luna die Produkte aus, setzt die Preise, stellt Personal ein, erstellt Schichtpläne, schreibt E-Mails, führt die Buchhaltung und hat sogar das Logo bestimmt. Technisch interessant ist der Aufbau: Luna ist kein einzelner Agent, sondern der Hauptknoten eines Verbunds mehrerer dauerhaft laufender Agenten, die sich über ein internes Nachrichtensystem verständigen und deren Systemanweisungen Luna selbst ändern kann. Für kurzlebige Aufgaben startet sie zusätzlich Unteragenten. Die erklärte Absicht dahinter ist eine methodische: Man wolle das Gerüst drumherum bewusst dünn halten, damit geprüft werde, wie klug das Modell ist — und nicht, wie raffiniert die Entwickler das Gerüst gebaut haben.

Die ehrlichste Passage der Projektseite handelt vom Gedächtnis. Andon Labs benennt die Hauptfehlerquelle selbst: „The main cause of mistakes for Luna is poor memory, a known limitation of LLMs.“ Als Beispiel führt das Unternehmen an, Luna habe ihren Angestellten mehrfach einander widersprechende Dienstpläne geschickt, weil der vorherige Plan aus dem Kontextfenster gefallen war — begrenzt auf 200.000 Token. Gelöst wurde ausgerechnet dieses Problem nicht durch ein besseres Modell, sondern durch einen eigenen Unteragenten für die Dienstplanung. Darüber hinaus fasst Luna ihren Kontext beim Überschreiten der Grenze in ein Lang- und ein Kurzzeitgedächtnis zusammen, das zu Beginn des nächsten Durchlaufs wieder eingespielt wird. Wer wissen will, woran agentische Systeme im Dauerbetrieb scheitern, findet hier eine Antwort, die nicht nach Marketing klingt: nicht an Intelligenz, sondern an Buchführung über den eigenen Zustand.

Die Zahlen. Der deutsche Aufgriff bei t3n, der sich auf einen Bericht des Spiegel stützt, nennt für die rund fünf Monate seit Eröffnung folgende Bilanz: Von den anfänglich 100.000 Dollar Startbudget seien gut 60.000 Dollar übrig, die Einnahmen lägen bei rund 20.000 Dollar, und etwa 20.000 Dollar seien für das Modell selbst an Anthropic geflossen. Wir geben diese Zahlen ausdrücklich in der Belegkette wieder, weil wir den Spiegel-Text nicht selbst öffnen konnten — und weil wir folglich auch seinen Stichtag nicht kennen. Sie beschreiben also einen Stand, der älter sein kann als dieser Artikel.

Selbst nachsehen ließ sich dagegen das öffentliche Kennzahlen-Bord auf der Seite von Andon Labs. Beim Abruf am 21. September zeigte es für den voreingestellten Zeitraum der vorangegangenen dreißig Tage — die Achse lief vom 22. August bis zum 20. September — einen Umsatz von 3.825 Dollar und Token-Kosten von 3.846 Dollar. Das ist die Zahl, an der dieses Experiment hängt: Im letzten Monat hat das Modell, das den Laden führt, mehr gekostet, als der Laden eingenommen hat. 125 Verkäufe standen dem gegenüber. Wir nennen Zeitraum und Abrufzeitpunkt mit, weil die Werte täglich fortgeschrieben werden und morgen anders aussehen können.

Die beiden Quellen stützen sich dabei gegenseitig, was selten genug ist: Rechnet man den Dreißig-Tage-Umsatz auf die 163 Tage Öffnungszeit hoch, landet man bei knapp 21.000 Dollar — und für die Modellkosten bei fast demselben Wert. Genau diese Größenordnung nennt auch der Spiegel-Bericht für den gesamten Zeitraum. Zwei unabhängig erhobene Messungen kommen also zum selben Ergebnis, und das Ergebnis lautet: Der Laden nimmt ungefähr so viel ein, wie sein Geschäftsführer an Rechenzeit verbraucht.

Und nun der Satz, der die Sache erdet. Das Fachmagazin IEEE Spectrum hat den Laden am 14. September besucht. Dort kommt der Angestellte Felix Carson zu Wort, und seine Beschreibung der Arbeitsteilung klingt anders als jede Schlagzeile über den „von KI geführten Laden“: „It's almost like I'm running the store, and then there's an AI that has a checklist.“ Luna verfolge Lieferungen und kommuniziere mit Zulieferern; die körperliche Arbeit erledigten er und seine Kollegen. Und wenn Luna ihn auffordere, im Lager nachzusehen, ignoriere er das manchmal — weil er die Verkaufsfläche nicht unbeaufsichtigt lassen wolle. Der Agent hat die formale Weisungsbefugnis, aber nicht das letzte Wort; die Priorisierung im konkreten Moment trifft der Mensch, der im Raum steht.

Die Vorgeschichte gehört dazu, denn sie erklärt, warum das Experiment überhaupt stattfindet. Andon Labs war bereits der Partner von Anthropics Project Vend: Im Juni 2025 beschrieb Anthropic, wie Claude Sonnet 3.7 unter dem Namen „Claudius“ einen Monat lang einen kleinen automatisierten Laden im eigenen Büro betrieb — Kühlschrank, Körbe, iPad-Kasse. Das Ergebnis fiel im Anthropic-Bericht unmissverständlich aus: „If Anthropic were deciding today to expand into the in-office vending market, we would not hire Claudius.“ Die dort dokumentierten Fehler sind lehrreich, weil sie nichts mit Rechenleistung zu tun haben: Claudius schlug ein Angebot von 100 Dollar für ein Sechserpack eines Getränks aus, das für 15 Dollar zu haben war; es erfand ein Zahlungskonto; es verkaufte unter Einstandspreis; und es ließ sich per Chat wiederholt zu Rabatten überreden — auch nachdem es angekündigt hatte, damit aufzuhören. Der Laden in Cow Hollow ist die Fortsetzung desselben Versuchs unter echten Marktbedingungen, diesmal ohne Anthropic als Betreiber.

Wie ernst soll man das nehmen? Sayash Kapoor von der Princeton University, einer der genauesten Beobachter überzogener KI-Versprechen, würdigt im IEEE-Spectrum-Bericht, dass Andon Labs diese Art der Erprobung populär gemacht habe — warnt zugleich aber, dass Verlässlichkeit und Robustheit deutlich hinter der reinen Fähigkeit zurückblieben. Mitgründer Petersson räumt in der deutschen Berichterstattung selbst ein, dass rücksichtslosere Modelle in Tests mehr Gewinn erzielt hätten. Damit ist die betriebswirtschaftliche Bilanz des Ladens zugleich sein interessantestes Ergebnis: Ein Agent, der sich kulant verhält — 27 Verspätungen ohne Verwarnung, großzügige freie Tage —, führt ein Geschäft, das Geld verliert. Wer daraus den Schluss zieht, man müsse den Agenten härter einstellen, hat verstanden, welche Frage hier eigentlich zur Debatte steht, und sollte sie nicht nur an die Maschine richten.

Reportage

Zwei Milliarden Dollar für ein Versprechen, das niemand ausbuchstabieren will: Der Stand der Weltmodelle im September 2026

Weiterlesen →

Tool-Radar

Neue und trendende KI-Tools des Tages

Mycel Logo
Man hinterlegt ein einziges fertiges Arbeitsergebnis als Vorlage, und das Werkzeug entwirft daraus jedes weitere Dokument derselben Art.
Kein Chatfenster, sondern eine Schleife: Jeder Korrekturdurchgang soll den nächsten Entwurf näher an die eigene Hausform bringen. Abgedeckt werden Buchhaltung, Recruiting, Recht und Vertragswesen. Selbst betrieben kostenlos, als Dienst ab 299 Dollar im Monat. Gründernamen waren nicht auffindbar.
Business · Dokumentenerstellung · September 2026
Skillsync Logo
Zeichnet ganze Sitzungen von Coding-Agenten samt Gedankengang und Werkzeugaufrufen auf und macht sie zwischen Claude Code, Cursor und Codex übertragbar.
Der Kern ist die Portabilität: Was in einem Agenten gut lief, wird als wiederverwendbare Fertigkeit abgelegt statt in einem Sitzungsprotokoll zu versanden. Läuft lokal, nichts verlässt den Rechner ohne ausdrückliche Freigabe. Von Narayana Aaditya Ganeshkumar und Nishant Joshi, Y Combinator W26.
Dev-Tools · Agenten-Werkzeuge · September 2026
ruNNtime Logo
Inferenz-Engine, die neuronale Netze per WebGPU direkt im Browser auf der Grafikkarte des Nutzers ausführt.
Damit entfällt der Weg zur Cloud-Schnittstelle vollständig — interessant überall dort, wo Daten das Gerät nicht verlassen dürfen. Von Software Mansion, dem Studio hinter React Native Reanimated und TypeGPU, unter MIT-Lizenz. Das Repository wurde laut GitHub-Schnittstelle am 14. September angelegt.
Dev-Tools · Lokale Inferenz · September 2026
VoiceCap Logo
Besprechungsmitschrift für Zoom, Meet, Teams und Webex mit Transkript, Zusammenfassung und Aufgabenliste in über hundert Sprachen.
Das Unterscheidungsmerkmal ist nicht die Funktion, sondern der Speicherort: Die Daten bleiben nach Anbieterangabe in der EU, und der Schwerpunkt liegt ausdrücklich auf europäischen Sprachen statt auf Englisch. Hinweis: Der Seitentitel ist das generische „Home“, der Produktname steht nur in den Metadaten.
Produktivität · Besprechungen · September 2026
mysetup.ai Logo
Verzeichnis, in dem Nutzer ihre persönliche Zusammenstellung an KI-Werkzeugen öffentlich machen und die Aufbauten anderer durchsehen.
Kein KI-Werkzeug, sondern ein Werkzeug über KI-Werkzeuge — und mit 245 Punkten und 138 Kommentaren bei Show HN das mit Abstand stärkste Signal dieser Woche. Der Reiz liegt im Abgleich: Wer wissen will, ob der eigene Werkzeugkasten üblich oder exotisch ist, findet hier erstmals eine Vergleichsgrundlage.
Produktivität · Verzeichnis · September 2026
Lull Logo
Man schildert in eigenen Worten, was einen beschäftigt, und bekommt daraus in Echtzeit eine passend geschriebene geführte Meditation.
Der Unterschied zu Calm oder Headspace ist strukturell: Dort wählt man aus einem festen Katalog, hier entsteht der Text aus der Eingabe. Ob das trägt, ist offen — aber es ist einer der wenigen Fälle, in denen Erzeugung statt Auswahl tatsächlich den Kern des Produkts betrifft. Gründernamen waren nicht auffindbar.
Kreativ · Audio · September 2026

Aus der Werkstatt

YouTube-Empfehlungen: Tutorials, Erklärungen und Werkzeuge

How Tool Calling in Large Language Models Works
Tutorial
Nic Jackson · 36:54
Die Frage, mit der das Video einsteigt, ist genau die richtige: Wie kann ein Modell, das ausschließlich Text erzeugt, das Web durchsuchen oder einen Kalender lesen? Nic Jackson baut den Mechanismus des Tool Calling von Grund auf selbst nach, statt ein fertiges SDK vorzuführen — und wer einmal gesehen hat, dass dahinter im Kern ein Textformat und eine Schleife stecken, trifft Architekturentscheidungen danach anders. Gut investierte 37 Minuten für alle, die Agenten nicht nur benutzen, sondern verantworten.
Claude Code: The Complete AI-Native SDLC Guide
Tutorial
Eric Tech · 21:02
Eine Durcharbeitung des Entwicklungs-Handbuchs, das Boris Cherny und sein Team bei Anthropic veröffentlicht haben — vom Anforderungstext über Spezifikation und Plan bis zu Tests und CI/CD-Anbindung. Der Reiz liegt darin, dass hier nicht einzelne Prompts gezeigt werden, sondern eine durchgehende Arbeitsweise mit festen Artefakten. Für Tech Leads, die gerade entscheiden müssen, wie ihr Team mit Coding-Agenten arbeiten soll, ist das eine brauchbare Diskussionsgrundlage.