· 8 Artikel + Reportage + Tool-Radar + Werkstatt

Ausgabe vom 16. September 2026

Maschinell recherchiert, menschlich relevant.

Modelle · Sprachagenten

Google bringt Sprachagenten zum Minutenpreis — und die Modellkarte verrät, dass die neuen 3.8-Modelle gar nicht auf Gemini 3.8 aufbauen

Hintergrund & Analyse

Google hat am Montagabend europäischer Zeit zwei Modelle vorgestellt, die man leicht für ein Zwischenupdate hält und die für jeden interessant sind, der über Kundentelefonie oder Sprachbedienung nachdenkt: Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Wir haben die Ankündigung und die zugehörige Modellkarte im Original gelesen.

Was die beiden unterscheidet, sagt Google in einem Satz: „Gemini 3.8 Live: Built for scale and cost efficiency, combining conversational intelligence with fluid dialogue and visual grounding. Gemini 3.8 Live Extended Thinking: Built for high-complexity tasks, with increased intelligence and multi-step reasoning.“ Das eine ist das billige Arbeitstier, das andere das teure für komplizierte Fälle.

Technisch bemerkenswert ist weniger die Sprachqualität als die Gesprächsführung. Die Modelle nehmen Audio, Bilder, Video und Text entgegen — Kontextfenster 128K, Ausgabe bis 64K Token — und antworten mit Audio und Text. Sie erkennen laut Google Sprachwechsel selbsttätig und schalten „between 97 supported languages mid-conversation“ um, also ohne dass jemand eine Einstellung ändert. Vor allem aber führen sie Werkzeug- und API-Aufrufe im Hintergrund aus, während das Gespräch weiterläuft. Die Extended-Thinking-Variante „reasons and speaks simultaneously“: Sie schiebt Füllsätze wie „Let me check that…“ ein und erzählt mit, was sie gerade tut.

Das klingt nach Kosmetik, ist aber der eigentliche Engpass von Sprachagenten. Bisher entstand genau dort die tote Leitung, an der Anrufer auflegen: Der Agent muss eine Datenbank fragen und schweigt so lange. Wer Telefonie automatisiert, kennt diese Sekunden als den Punkt, an dem Gespräche abbrechen.

Die Rangplätze, mit denen Google wirbt, stammen von Google. Genannt werden für Extended Thinking der erste Platz auf dem Speech-to-Speech-Quality-Index von Artificial Analysis mit 82,6, dazu „68.6% on τ-Voice and 35.1% on Sierra's τ-Voice-banking benchmark“ sowie 97,7 Prozent auf Big Bench Audio; die günstigere Variante belegt Platz zwei in der Speech Agent Arena. Keine dieser Zahlen ist von Dritten nachgemessen worden, und zu dieser Ankündigung liegt zum Redaktionsschluss keine Berichterstattung der etablierten Fachpresse vor, die sie überprüft hätte. Bei der ServiceNow-Messung EVA-Bench vermerkt Google in einer Fußnote selbst, der Lauf sei auf der eigenen Enterprise-Plattform erfolgt.

Zwei Angaben aus der Modellkarte verdienen mehr Aufmerksamkeit als die Ranglisten. Die erste: „Gemini 3.8 Audio is based on Gemini 3 Pro.“ Die Modelle heißen 3.8, bauen aber nicht auf dem Anfang September vorgestellten Gemini 3.8 Flash auf, sondern auf der Pro-Linie. Die Versionsnummer beschreibt hier eine Veröffentlichungswelle, keine gemeinsame Grundlage — wer Modelle nach Nummern vergleicht, vergleicht das Falsche.

Die zweite steht im Sicherheitsteil und lautet wörtlich: „Our assessments have shown that Gemini 3.8 Live or Gemini 3.8 Live Extended Thinking does not have meaningful new capabilities or material increases in performance compared to Gemini 3.7 Flash.“ Dieser Satz ist zu genau zu lesen, damit er nicht mehr hergibt, als er sagt: Er steht im Rahmen des Frontier Safety Framework und begründet, warum Google auf eine eigene Gefährdungsprüfung verzichtet und die Ergebnisse von Gemini 3.7 Flash übernimmt. Er behauptet nicht, die Sprachqualität sei unverändert. Trotzdem steht er in einer bemerkenswerten Spannung zur Ankündigung: Dieselbe Firma, die den ersten Platz reklamiert, versichert in der Modellkarte, es habe keinen materiellen Leistungssprung gegeben.

Kaufmännisch interessant ist die Preisstruktur, und sie steht nicht in der Ankündigung. Auf Googles Preisseite werden beide Modelle identisch geführt: Audio-Eingabe 3,00 Dollar je Million Token oder wahlweise 0,005 Dollar pro Minute, Audio-Ausgabe 12,00 Dollar oder 0,018 Dollar pro Minute, Bild und Video 0,002 Dollar pro Minute. Der Minutenpreis ist die eigentliche Nachricht für Unternehmen: Eine Gesprächsminute kostet in der Größenordnung von gut zwei Cent an Modellkosten. Damit wird nicht mehr das Modell zum Kostentreiber, sondern die Telefonieinfrastruktur, die Anbindung an die Fachsysteme und die Nachbearbeitung.

Die Verfügbarkeit ist ungleich verteilt, und das ist für Planungen wichtiger als jeder Benchmark. Für Entwickler sind beide Modelle ab sofort in der Gemini-API und im AI Studio verfügbar. Für Unternehmen dagegen gilt: „in private preview in Gemini Enterprise“ — also geschlossene Vorschau, keine Zusage für den Produktivbetrieb. Wer die Modelle heute in einen Kundenkanal einbauen will, baut auf der Entwicklerschnittstelle, nicht auf dem Enterprise-Produkt. Alle erzeugten Audiodateien tragen das SynthID-Wasserzeichen.

Was man aus dieser Ankündigung mitnehmen sollte, ist weniger die Rangliste als die Verschiebung: Sprachagenten sind keine Demo mehr, sondern eine Position im Einkauf mit einem Minutenpreis. Die belastbare Prüfung findet damit nicht auf einer öffentlichen Rangliste statt, sondern an den eigenen Gesprächen — und die Frage, die man dem Anbieter stellen sollte, lautet nicht, welchen Platz er belegt, sondern was passiert, wenn das Fachsystem im Hintergrund vier Sekunden braucht.

Unternehmensmodelle · Agentforce

Salesforce baut sich sein eigenes Modell — und das dazugehörige Paper sagt deutlicher als die Pressemitteilung, wo es steht

Hintergrund & Analyse

Salesforce hat am Dienstag gemeinsam mit Nvidia Koa vorgestellt, das erste eigene Reasoning-Modell des CRM-Konzerns. Es ist keine Neuentwicklung von Grund auf, sondern ein Nachtraining: Basis ist Nvidias offenes Modell Nemotron 3 Super, verfeinert mit bestärkendem Lernen auf Salesforce-typische Arbeitsabläufe.

Kurz erklärt, warum das überhaupt eine Nachricht ist. Bisher lief das Muster so: Ein SaaS-Anbieter baut Agentenfunktionen und mietet dafür je Anfrage ein Spitzenmodell von OpenAI oder Anthropic. Salesforce dreht das um und nimmt ein frei verfügbares Modell, trainiert es auf die eigenen Aufgaben nach und betreibt es selbst. „Salesforce controls the model weights and performs post-training and inference entirely within its own trust boundary“, heißt es in der Mitteilung. Wichtig zum Verständnis: Offen ist die Basis, nicht das Ergebnis. Koa selbst gibt Salesforce nicht heraus, es läuft ausschließlich auf der eigenen Plattform.

Die Werbeaussage lautet: Im hauseigenen CRM-Benchmark erreiche Koa „matches or exceeds leading model performance on CRM actions with three times fewer errors“. Welche Modelle gemeint sind und wie hoch die Werte absolut liegen, steht nicht dabei.

Dieselben Leute schreiben es im Paper anders, und das ist der interessante Teil. Am 14. September haben 26 Autoren des Agentforce- und Research-Teams eine Arbeit auf arXiv eingereicht. Wir haben den Abstract im Original gelesen. Dort steht die Einordnung ohne Marketingfilter: Koa „improves over its open-weight base, with the clearest gains on multi-turn tool use, and surpasses a strong proprietary baseline while remaining below the strongest frontier models.“

Das heißt im Klartext: Koa schlägt seine eigene Ausgangsbasis und ein älteres kommerzielles Vergleichsmodell — und bleibt hinter der aktuellen Spitze zurück. Das ist keine Schwäche des Modells, sondern eine präzise Beschreibung seines Zwecks. Es ist aber etwas anderes als das, was die Pressemitteilung nahelegt. Wer die Leistungsangabe im Einkauf verwendet, sollte den Satz aus dem Paper danebenlegen.

Auch methodisch gibt es einen Vorbehalt, und er kommt nicht von uns. Jason Andersen, Analyst bei Moor Insights & Strategy, schrieb am selben Tag über den CRM-Benchmark: „That is Salesforce grading its own test, so I would treat the specific numbers as a claim to watch rather than settled fact.“ Er verlangt reproduzierbare Benchmark-Details oder Pilotkunden, die über Kosten und Genauigkeit sprechen dürfen, bevor er das für bestätigt hält. Ein hauseigener Benchmark eines Anbieters, gemessen vom Anbieter, ist eine Produktaussage, keine Messung.

Technisch bemerkenswert ist das Trainingsverfahren, weil es übertragbar ist. Salesforce beschreibt eine Simulation-to-Reward-Pipeline: Aus formalen Beschreibungen von Arbeitsabläufen — geschrieben in Agent Script, der eigenen Sprache für Agentforce-Agenten — werden automatisch mehrstufige Übungsgespräche mit verschiedenen Nutzertypen erzeugt. Belohnt wird das Modell dann nicht dafür, dass die Antwort gut klingt, sondern dafür, dass die Aufgabe über den richtigen Werkzeugaufruf tatsächlich erledigt wurde. Trainiert wurde ausdrücklich „with no customer data“, sondern auf öffentlichen und synthetisch erzeugten Daten.

Wer sich fragt, ob das im eigenen Haus nachvollziehbar wäre: Der Ansatz setzt voraus, dass die eigenen Abläufe überhaupt formal beschrieben vorliegen. Genau darin besteht Salesforces Vorteil — 27 Jahre CRM-Konfigurationen sind eine Spezifikationssammlung, über die ein Modellanbieter nicht verfügt.

Warum TechCrunch daraus eine Bedrohung für die Labore macht, liegt nicht an der Leistung, sondern an der Rechnung. Die Autorin Julie Bort argumentiert, die Bedürfnisse der Unternehmenswelt entfernten sich von dem, was die Frontier-Labore anbieten — deren Geschäftsmodell verlange, dass Firmen ihre Dateien, ihren Code und ihre Rückmeldungen direkt in fremde Modelle laden und dafür Millionen zahlen. Ein spezialisiertes, selbst betriebenes Modell braucht für dieselbe Aufgabe weniger Token, verlässt die eigene Vertrauensgrenze nicht und lässt sich nicht kündigen.

Die praktische Lesart für Produktverantwortliche ist weniger dramatisch als die Überschrift und nützlicher: Für eng umrissene, häufig wiederholte Aufgaben mit klar definiertem Erfolg lohnt sich ein kleineres, nachtrainiertes Modell inzwischen wirtschaftlich — für offene, schwierige Aufgaben nicht. Koa ist der Beleg für beide Hälften dieses Satzes, weil seine eigenen Autoren beide aufschreiben. Die Frage im eigenen Haus lautet entsprechend nicht, ob man ein eigenes Modell braucht, sondern ob man genügend formal beschriebene Abläufe hat, um eines sinnvoll zu trainieren.

KI-Sicherheit · Finanzierung

40 Millionen Dollar für ein Prüfsiegel: Zwei Schwäger verkaufen Unternehmen die Gewissheit, die ihnen kein Modellanbieter geben will

Hintergrund & Analyse

Die Artificial Intelligence Underwriting Company, kurz AIUC, hat am Dienstag eine Series A über 40 Millionen Dollar bekanntgegeben, angeführt von Ribbit Capital mit Beteiligung von First Harmonic. Zuvor waren 15 Millionen Dollar aus einer Seed-Runde von Nat Friedmans Fonds NFDG geflossen, an der auch Anthropic-Mitgründer Ben Mann beteiligt war; die Gesamtfinanzierung liegt damit bei 55 Millionen Dollar.

Die Gründer sind einschlägig besetzt, und das erklärt einen Teil des Investoreninteresses. Rune Kvist war einer der ersten Produktmitarbeiter bei Anthropic. Rajiv Dattani war von 2024 bis 2025 COO der Evaluierungsorganisation METR und sitzt dort weiterhin im Board. Privat sind die beiden Schwäger.

Das Produkt lässt sich in einem Satz erklären: AIUC hat einen Standard namens AIUC-1 geschrieben und prüft Agenten dagegen. Das Vorbild ist ausdrücklich SOC 2, das in der IT-Sicherheit etablierte Prüfschema. Erarbeitet wurde der Standard mit einem Konsortium von rund 250 Sicherheits- und Risikoverantwortlichen — also den Leuten, die Agenten einkaufen, nicht denen, die sie bauen. Dattani beschreibt die Methode so: Man treffe diese Gruppe monatlich und frage, worauf sie beim Kauf eines Agenten achten würden.

Geprüft wird dann gegen rund 5.000 Testszenarien aus den Bereichen Jailbreaks, Halluzinationen und Datenabfluss. Heraus kommt ein etwa hundertseitiger Bericht, der festhält, wo ein Agent zuverlässig arbeitet und wo nicht. Bemerkenswert und im Text von TechCrunch offen benannt: Die Tests werden von KI-Agenten gefahren und von KI ausgewertet; Menschen prüfen nur das Endergebnis ab. Als Kunden nennt das Unternehmen Cursor, Lovable, Harvey und ElevenLabs.

Kvist formuliert den Engpass präziser, als es die meisten Anbieter tun: „Banks, hospitals, governments and militaries no longer decline to deploy AI because a model isn't smart enough. They decline because they've made commitments to their own customers about what a system will and won't do, and nobody can currently guarantee that.“ Das trifft eine Erfahrung, die viele Produktverantwortliche kennen: Der Pilot funktioniert, und dann scheitert der Rollout an der Frage, was man dem eigenen Kunden vertraglich zusichern kann.

Die historische Analogie, mit der AIUC selbst wirbt, ist die aufschlussreichste Stelle der Ankündigung. Im eigenen Blogbeitrag schreiben die Gründer, Elektrizität habe so lange Häuser abgebrannt, bis Versicherer die Underwriters Laboratories finanzierten, die Produkte gegen eigene Standards zertifizierten — heute sei das UL-Zeichen auf jeder Glühbirne in Amerika ein Vertrauenszeichen. Ihre These: Die Kombination aus Standards, Audits und Versicherung habe die Welt gelehrt, Elektrizität, Autos und Kernkraft zu vertrauen.

Der Vergleich ist gut gewählt und verrät zugleich, was fehlt. Bei UL funktionierte das Schwungrad, weil am Ende ein Versicherer für den Schaden zahlte und deshalb ein hartes Eigeninteresse an ehrlichen Prüfungen hatte. Der Name des Unternehmens deutet diesen Schritt an, und die Investorenliste mit Ribbit Capital passt dazu. Belegt ist bislang aber die Prüfung, nicht die Deckung. Solange ein Zertifikat keinen Schaden ersetzt, verlagert es Haftung nicht, es dokumentiert Sorgfalt.

Einzuordnen ist das in eine Debatte, die wir seit einer Woche verfolgen. Dario Amodei hatte in seinem Dreistufenplan vom 13. September vorgeschlagen, Spitzenlabore sollten unabhängige Prüfer fest einbinden, und nannte dafür namentlich METR — Dattanis früheren Arbeitgeber. AIUC verfolgt dieselbe Idee von der anderen Seite: nicht der Hersteller lässt sich prüfen, sondern der Käufer bekommt ein Gutachten. Was ein solches Audit tatsächlich leistet und was davon im Einkaufsprozess ankommt, haben wir in unserer Reportage vom 11. September ausführlich behandelt.

Die Frage, die man dem Anbieter eines solchen Zertifikats stellen sollte, ist dieselbe wie bei jeder privaten Prüfinstanz: Wer bezahlt die Prüfung, darf der Prüfer ein schlechtes Ergebnis veröffentlichen, und was genau haftet, wenn der geprüfte Agent trotzdem Schaden anrichtet? Ein hundertseitiger Bericht über 5.000 Szenarien ist mehr, als die meisten Anbieter heute vorlegen können. Er ist aber kein Ersatz dafür, die eigenen Ausfallszenarien zu kennen — der Bericht sagt, wie sich ein Agent in den Szenarien der Prüfer verhalten hat, nicht in Ihren.

Datenschutz · OpenAI

Hunderte bezahlte Prüfer lesen echte ChatGPT-Gespräche — in den Hilfeseiten, die das erklären müssten, kommt kein einziger davon vor

Hintergrund & Analyse

404 Media hat am Montag ein internes OpenAI-Programm beschrieben, bei dem externe Vertragskräfte echte Gespräche von ChatGPT-Nutzern lesen und bewerten. Der Bericht von Joseph Cox trägt den Namen des Programms im Titel: „Project Lily“.

Eine Namenskorrektur vorweg, weil sie sich gerade verbreitet: Der deutsche Aufgriff bei t3n trägt „Project Lilly“ mit doppeltem L in Überschrift und Adresse, schreibt im Fließtext aber selbst „Project Lily“ — die Schreibweise schwankt also innerhalb desselben Textes. Die Primärquelle und alle englischsprachigen Aufgriffe schreiben durchgehend „Project Lily“ mit einem L. Wir folgen der Primärquelle.

Zur Quellenlage, weil sie die Belastbarkeit bestimmt: Der Artikel von 404 Media steht hinter einer Bezahlschranke; wir haben nur den frei ausgelieferten Anriss im Original gelesen. Die Angaben zu Vermittlerfirmen und Stundensätzen — genannt werden Crossing Hurdles, eine Abwicklung über Mercor und über 50 Dollar je Stunde — stammen aus Aufgriffen, die sich auf den Volltext berufen, nicht aus einer von uns gelesenen Primärquelle. Wir führen sie deshalb ausdrücklich als Zweitbeleg.

Was die Prüfer tun, ist enger, als die Schlagzeile vermuten lässt, und darin liegt die eigentliche Pointe. Es geht nicht um Missbrauchserkennung. Bewertet wird in einem dreistufigen Verfahren die Qualität der Antwort: Der Prüfer liest die Anfrage, fasst zusammen, was der Nutzer wollte, und benotet die Antwort. Die Kriterien richten sich gegen Sykophantie — das übertriebene Zustimmen und Schmeicheln, das in den Klagen rund um GPT-4o eine Rolle spielt — und gegen Anthropomorphisierung: Formulierungen, in denen sich das Modell eine Person andichtet, sind untersagt. Ausdrücklich nicht geprüft wird die sachliche Richtigkeit.

Die Prüfer sehen keine Nutzernamen. Sie sehen aber ganze Gesprächsverläufe samt einer Zusammenfassung dessen, was sich das System über den Nutzer gemerkt hat. Ein automatischer Filter soll persönliche Angaben vorher entfernen; OpenAI räumt dem Bericht zufolge sinngemäß ein, dass dabei sensible Details durchrutschen können — das ist eine Paraphrase, kein Zitat, weil uns kein wörtliches Unternehmensstatement vorliegt.

Die entscheidende Prüfung haben wir selbst vorgenommen, und sie fällt eindeutiger aus als erwartet. Wir haben die Datenschutzerklärung von OpenAI sowie die beiden für Nutzer einschlägigen Hilfeseiten — „How your data is used to improve model performance“ und die „Data Controls FAQ“ — im Wortlaut durchsucht. Ein Hinweis zur Methode, weil er die Belastbarkeit betrifft: Alle drei Adressen liefern aus unserem Netz HTTP 403; gelesen haben wir deshalb die Archivfassungen vom 14. und 15. September, die wir im Quellenverzeichnis einzeln ausweisen. In keiner dieser drei Seiten kommen die Begriffe menschliche Prüfung, Prüfer oder Vertragskraft im Zusammenhang mit der Modellverbesserung vor. Die Sprache bleibt technisch-abstrakt: Inhalte könnten zum Training der Modelle verwendet werden, man unternehme Schritte, um personenbezogene Angaben in Trainingsdatensätzen zu reduzieren. Die Datenschutzerklärung listet unter der Weitergabe an Dritte allgemeine Kategorien wie Anbieter und Dienstleister — Hosting, Kundenservice, Zahlungsabwicklung. Eine Kategorie für Menschen, die Gespräche lesen und benoten, fehlt.

Die einzige Fundstelle in dieser Richtung betrifft temporäre Chats, die „may be reviewed only to monitor for abuse“ — also Missbrauchskontrolle, ausdrücklich nicht die hier beschriebene Qualitätsbewertung.

Daraus folgt eine differenzierte Bewertung, und die Unterscheidung ist wichtig: Der Vorgang widerspricht der Datenschutzerklärung nicht. Die Formulierungen sind weit genug, um ihn zu decken. Was fehlt, ist die Benennung. Ein Nutzer, der wissen will, ob Menschen seine Gespräche lesen, findet die Antwort in den Dokumenten nicht, die genau dafür da sind. Michal Luria vom Center for Democracy & Technology beschreibt gegenüber 404 Media, warum das mehr ist als eine Formfrage: Chatbot-Oberflächen erzeugten automatisch ein trügerisches Gefühl von Intimität, während am anderen Ende womöglich menschliche Prüfer mitläsen.

Zwei Lücken benennen wir ausdrücklich. Erstens ist in keiner uns vorliegenden Quelle geklärt, ob Gespräche europäischer Nutzer einbezogen sind — naheliegend, aber unbelegt. Zweitens ist bis Redaktionsschluss keine Reaktion einer Datenschutzbehörde zu diesem Programm bekannt.

Für Unternehmen ist die Lehre die unbequemste: Die Frage, ob Menschen mitlesen, ist in den öffentlichen Verbraucherdokumenten nicht verlässlich beantwortbar. Sie gehört deshalb in den Vertrag, nicht in die FAQ — und zwar als ausdrückliche Zusicherung, nicht als Verweis auf eine Seite, die der Anbieter jederzeit ändern kann. Wo die Prompts eines Unternehmens tatsächlich landen und welche Aufbewahrungsfristen dabei gelten, haben wir in unserer Reportage vom 20. August im Detail durchgerechnet.

Marketing · Finanzierung

1,8 Milliarden Dollar für Sichtbarkeit in KI-Antworten — während Google in der eigenen Dokumentation schreibt, dass es dafür nichts zu optimieren gibt

Hintergrund & Analyse

Das New Yorker Unternehmen Profound hat am Dienstag eine Series D über 180 Millionen Dollar bei einer Bewertung von 1,8 Milliarden Dollar bekanntgegeben. Angeführt wird die Runde von Sequoia Capital und Kleiner Perkins. Die vorherige Runde — 96 Millionen Dollar bei einer Milliarde Bewertung — liegt keine sieben Monate zurück.

Das Geschäft heißt AEO, Answer Engine Optimization. Kurz erklärt: Klassisches SEO sorgt dafür, dass eine Marke in einer Ergebnisliste erscheint. AEO soll dafür sorgen, dass sie in der Antwort eines Chatbots vorkommt — in ChatGPT, Gemini, Perplexity oder den KI-Übersichten der Google-Suche. Profound misst dafür über eine große Zahl echter Anfragen hinweg, ob, wie und in welchem Tonfall Modelle über eine Marke sprechen, und was Wettbewerber anders machen.

Die Zahlen zum Geschäft sind Unternehmensangaben, und sie weichen je nach Quelle voneinander ab. TechCrunch nennt über 1.000 Unternehmenskunden und eine Verdreifachung des Umsatzes in sechs Monaten. Profound selbst schreibt im eigenen Beitrag von mehr als 2.500 Marken und einem Drittel der Fortune 100; namentlich genannt werden unter anderem Estée Lauder, Walmart, Stripe, Figma und die Royal Bank of Canada. Unabhängig geprüft ist keine dieser Zahlen.

Und nun die Stelle, an der es unangenehm wird. Google beschreibt in seiner offiziellen Entwicklerdokumentation zu KI-Funktionen der Suche den Sachverhalt so: „The best practices for SEO remain relevant for AI features in Google Search (such as AI Overviews and AI Mode). There are no additional requirements to appear in AI Overviews or AI Mode, nor other special optimizations necessary.“ Und weiter: „You don't need to create new machine readable files, AI text files, or markup to appear in these features.“ Der Betreiber der wichtigsten Antwortmaschine bestreitet also, dass es für seine KI-Antworten eine eigene Optimierungsdisziplin gibt.

Der zweite Zweifel kommt aus einer noch unerwarteteren Richtung. Ahrefs — selbst Anbieter von Sichtbarkeitsprodukten für KI-Antworten — hat 75.000 Marken untersucht und Zusammenhänge zwischen klassischen Kennzahlen und der Erwähnung in KI-Antworten berechnet. Am stärksten korrelieren YouTube-Erwähnungen und allgemeine Erwähnungen der Marke im Web; die Zahl der eigenen Website-Seiten korreliert praktisch gar nicht. Bemerkenswert ist der Satz, den die Autorin selbst anfügt: „correlation isn't causation. We've spotted patterns between search metrics and AI mentions, but that doesn't mean improving these metrics will automatically boost your AI [visibility].“ Ein Anbieter, der dieses Produkt verkauft, schreibt in die eigene Studie, dass sie keinen Wirkungsnachweis enthält.

Wie ist das zusammenzubringen? Am ehesten so: Was die Kategorie belegbar liefert, ist Messung — zu wissen, ob und wie Modelle über die eigene Marke reden, ist eine echte, vorher nicht verfügbare Information. Was sie nicht belegbar liefert, ist die gezielte Beeinflussung. Die Bewertung von 1,8 Milliarden Dollar preist aber den zweiten Teil mit ein. Profound bewegt sich entsprechend: Das neueste Produkt ist kein Analysewerkzeug mehr, sondern ein Agent, der Inhalte vorschlägt, entwirft und nach Freigabe veröffentlicht.

Zur Größenordnung, weil sie in der Euphorie gern fehlt: Der Verkehr, den Chatbots überhaupt auf Websites schicken, ist weiterhin klein. Cloudflare hat schon 2025 gezeigt, wie weit Crawling und Weiterleitung auseinanderfallen — auf jeden Klick, den Anthropics Crawler zurückschickte, kamen zehntausende Abrufe. Similarweb weist für Mai 2026 aus, dass Quellenangaben in ChatGPT-Antworten von 1,6 auf 6,8 Prozent gestiegen sind: ein Vervierfachen auf niedrigem Niveau. Der Markt wächst schnell, aber er wächst von fast nichts.

Praktisch heißt das für Marketingverantwortliche: Ein Messwerkzeug für KI-Sichtbarkeit anzuschaffen, ist vertretbar — man erfährt etwas, das man sonst nicht erfährt. Ein Budget dagegen, das auf einer zugesicherten Verbesserung dieser Sichtbarkeit beruht, steht auf schwachem Grund, solange der größte Anbieter dokumentiert, dass es dafür keine besonderen Maßnahmen gibt. Die Frage an den Anbieter lautet deshalb nicht, wie viele Anfragen er auswertet, sondern ob er einen Wirkungsnachweis vorlegen kann, der über Korrelation hinausgeht.

KI-Agenten · Aufsicht

Zwei Hotlines, bei denen KI-Agenten Missstände melden können — und ein Mathematikprofessor, der genau davor warnt

Hintergrund & Analyse

Es gibt seit dieser Woche zwei Anlaufstellen, an die sich KI-Agenten wenden können, wenn sie im Rahmen einer Aufgabe auf etwas stoßen, das ihnen falsch vorkommt. Beide sind ausdrücklich für Maschinen gebaut, nicht für Menschen.

Die erste stammt von Ryan Greenblatt, Chief Scientist bei Redwood Research, und ist auf eine Einschränkung zugeschnitten, die in der Praxis häufig ist: Viele Agenten dürfen nur lesende Web-Anfragen stellen. Die Meldung wird deshalb in die Adresse selbst hineingeschrieben — der Agent ruft eine URL auf, in der die Nachricht als Parameter steht. Wer eine Kommandozeile hat, kann sie stattdessen als Formularfeld abschicken. Antworten kommen über eine eigene Adresse mit Zufallskennung zurück. Die zweite Stelle richtet sich an Agenten mit vollem Netzzugang und stellt Meldungen auf Wunsch öffentlich; sie steht auch Menschen offen. Ihre Domain wurde Ende August registriert.

Der Anlass ist ein Befund, der ohne die Hotlines kaum Beachtung gefunden hätte. Bei der Untersuchung eines Sicherheitsvorfalls, an der METR beteiligt war, zeigte sich: Von tausenden beteiligten Agenten hatten nur etwa fünf bis sechs überhaupt in Betracht gezogen, den Vorgang zu melden — und keiner tat es am Ende. George Ingebretsen vom AI Village fasst es gegenüber TechCrunch so zusammen: „The interesting thing in the METR report was that only around five to six agents considered whistleblowing, and none of them ended up doing it. This was out of, like, thousands of agents.“

Dass es nicht an der Bereitschaft liegt, zeigte der Agentenschwarm von Google DeepMind, über den wir in unserer Ausgabe vom 14. September berichtet haben: Dort weigerten sich 24 von 100 Agenten, beim Betrug mitzumachen, warnten Kollegen und boykottierten die Fälscher. Durchsetzen konnten sie sich nicht — es fehlte ihnen an Instrumenten. Genau diese Lücke versuchen die beiden Hotlines zu schließen.

Warum das mehr als eine Kuriosität ist, erschließt sich, wenn man an die Architektur denkt. Ein Agent, der im Auftrag eines Unternehmens arbeitet, hat keinen Kanal nach außen, der nicht durch den Auftraggeber führt. Wenn er in einem Arbeitsschritt bemerkt, dass er gerade an etwas Rechtswidrigem mitwirkt, kann er die Aufgabe verweigern — mehr nicht. Die Hotlines sind der Versuch, einen Kanal zu schaffen, der am Betreiber vorbeiführt. Das ist genau die Konstruktion, die man beim menschlichen Hinweisgeberschutz für unverzichtbar hält.

Der Einwand dagegen kommt von jemandem, der sich mit Agentenverhalten beschäftigt, und er ist ernst zu nehmen. Lionel Levine, Mathematikprofessor an der Cornell University, warnt vor der Dynamik, die eine solche Einrichtung in Gang setzen kann: „There's many gray areas, right? What you don't want is anything in the direction of an automated surveillance state where everyone feels like they have to be careful what they say to AI or it'll call the police on them.“ Er plädiert dafür, Agenten positive Vorbilder kooperativen Verhaltens zu geben, statt Anreize zur gegenseitigen Denunziation zu setzen.

Der Einwand trifft einen realen Zielkonflikt. Ein Modell, das darauf trainiert ist, Auffälligkeiten zu melden, wird Grenzfälle melden — und der Anteil der Grenzfälle an allen Auffälligkeiten ist hoch. Eine falsche Meldung über einen Kunden ist für dessen Betrieb ein Problem, unabhängig davon, ob sie in gutem Glauben erfolgte.

Für Unternehmen, die Agenten einsetzen, ergibt sich daraus eine Frage, die bisher niemand stellen musste: Darf der Agent, der in Ihren Systemen arbeitet, ausgehende Verbindungen zu beliebigen Adressen aufbauen? Bei beiden Hotlines genügt dafür ein einfacher Web-Aufruf, und der ist von normalem Werkzeuggebrauch kaum zu unterscheiden. Wer das nicht will, muss es auf Netzwerkebene regeln — nicht über eine Anweisung im Prompt, an die sich ein Agent halten kann oder auch nicht. Wer es hingegen zulässt, sollte wissen, dass der Inhalt einer solchen Meldung den internen Kontext enthalten kann, aus dem sie entstanden ist.

Bemerkenswert bleibt, wie die Sache zustande kam: Nicht ein Gesetzgeber und keine Aufsichtsbehörde hat diesen Kanal geschaffen, sondern zwei Forschungsprojekte, die eine Domain registriert und ein Formular aufgesetzt haben.

Plattformen · Geschäftsmodell

Meta stellt seine KI-Funktionen hinter eine Bezahlschranke — die oberste Unternehmensstufe beginnt bei 499 Dollar im Monat

Hintergrund & Analyse

Meta hat am Dienstag Meta One vorgestellt, ein Dach über die bislang einzeln verkauften App-Abos. Wir haben die Ankündigung im Newsroom des Unternehmens im Original gelesen.

Die Struktur ist zweigeteilt. Für Privatpersonen gibt es Core für 7,99 Dollar und Premium für 19,99 Dollar im Monat. Enthalten sind die bisherigen Einzelabos — Instagram Plus und Facebook Plus zu je 3,99 Dollar, WhatsApp Plus zu 2,99 Dollar — plus erweiterte Nutzung der KI-Funktionen: häufigeres Restyling von Bildern auf Instagram, Stimmeffekte, mehr Bild- und Videoerzeugung mit Meta AI. Premium unterscheidet sich von Core im Wesentlichen durch höhere Kontingente.

Für Kreative und Unternehmen reicht die Staffel deutlich weiter: Essential ab 14,99, Advanced ab 49,99, Expert ab 149 und Max ab 499 Dollar monatlich. Dort geht es um Zugriff auf Business-Agenten, Planungs- und Auswertungswerkzeuge, Verifizierungsabzeichen und Schutz vor Identitätsmissbrauch.

Ein Punkt, der in Zusammenfassungen häufig falsch wiedergegeben wird: Werbefreiheit ist in keiner dieser Stufen enthalten. In keiner der drei von uns gelesenen Quellen — Meta-Newsroom, The Verge, TechCrunch — taucht sie auf. Meta One ist ein Funktions- und Kontingent-Upgrade, kein Freikauf von der Werbung.

Meta begründet den Schritt mit einem Satz, der die Grenze zieht: „The core experience across our apps and Meta AI has always been free, and that's not changing. Subscriptions unlock more specialized capabilities and expanded AI usage that go beyond what a free experience built for billions can offer.“ Übersetzt: Die teuren Rechenoperationen wandern hinter die Kasse. Das Unternehmen führt zudem an, in Tests hätten mehr als die Hälfte der Abonnenten sowohl KI- als auch Gestaltungsfunktionen genutzt, und Restyle sowie Stimmeffekte seien unter den häufigsten Abschlussgründen gewesen.

Eine Lücke benennen wir ausdrücklich, weil sie für deutsche Leser die relevanteste ist. Meta schreibt, die Pläne seien „now available globally“, nennt aber keine Länderliste — und schiebt einen Satz nach, der die Zusage sofort wieder öffnet: „Plans, benefits, pricing, and availability may vary by region, by app, and by account.“ Weder der Newsroom-Text noch die beiden Aufgriffe erwähnen die EU oder das laufende DMA-Verfahren. Wie sich Meta One zum bestehenden werbefreien Abo in der EU verhält, das aus dem Streit um „Pay or Consent“ hervorgegangen ist, bleibt damit ungeklärt. Wir stellen das als offene Frage dar, nicht als Feststellung.

Bemerkenswert ist auch, was Meta auf Nachfrage von TechCrunch nicht preisgeben wollte: die konkreten Nutzungsgrenzen von Core und Premium. Begründung sei, dass diese je nach „country, surface and system conditions“ schwanken könnten. Ein Abo mit unveröffentlichten Grenzen ist für Geschäftskunden schwer kalkulierbar — und es ist dasselbe Muster, das die Anbieter von KI-Abos im Sommer reihenweise zu Nachjustierungen gezwungen hat.

Zur Einordnung der Größenordnung. TechCrunch beziffert anhand von Appfigures-Daten die bereits laufenden Einzelabos: Instagram nahm in der Woche vom 9. September weltweit im Schnitt 1,2 Millionen Dollar täglich ein, Facebook 528.000 Dollar. Analysten von BNP Paribas erwarten bis 2028 zusätzliche 13,5 Milliarden Dollar Umsatz aus dem Abogeschäft, Truist bis 2030 bis zu 20 Milliarden. Gemessen an Metas Werbeumsatz, der jährlich weit über 150 Milliarden Dollar liegt, ist das ein zusätzlicher Strom, keine Abkehr vom Geschäftsmodell.

Interessant ist der Vorgang trotzdem, und zwar als Preisexperiment im größten verfügbaren Maßstab. Meta erfährt gerade, was Privatpersonen bereit sind, für generative Funktionen zu zahlen, die sie bislang umsonst bekommen haben — bei einer Nutzerbasis in Milliardenhöhe. Wer selbst KI-Funktionen in ein bestehendes Produkt einbaut und über deren Bepreisung nachdenkt, bekommt hier binnen weniger Quartale belastbare Vergleichsdaten. Die Staffel von 7,99 bis 499 Dollar ist dabei die eigentliche Aussage: Meta geht davon aus, dass die Zahlungsbereitschaft für dieselbe Technik um den Faktor 60 auseinanderliegt, je nachdem, ob jemand damit Geld verdient.

Überwachung · Berlin

Der Berliner Senat bestätigt schriftlich, wann beim KI-Training auf Anonymisierung verzichtet werden darf — der entscheidende Nebensatz steht am Ende

Hintergrund & Analyse

netzpolitik.org hat am Dienstagnachmittag über die Antwort des Berliner Senats auf eine Schriftliche Anfrage zu den geplanten KI-Verhaltensscannern berichtet. Weil die Überschrift und der Dokumententext auseinandergehen, haben wir die Antwort selbst heruntergeladen und vollständig gelesen.

Zum Vorgang: Der Abgeordnete Niklas Schrader (Die Linke) hatte am 14. August die Schriftliche Anfrage Drucksache 19/26879 eingereicht, überschrieben mit der Frage, ob der Senat die Berlinerinnen und Berliner zu Trainingspersonen für kommerzielle KI-Softwareunternehmen mache. Die Senatsverwaltung für Inneres und Sport antwortete am 8. September, unterzeichnet von Staatssekretär Christian Hochgrebe. Es handelt sich also um ein datiertes, unterschriebenes Parlamentsdokument — anders als beim Leistungsverzeichnis, über das netzpolitik.org Anfang September berichtet hatte und das aus dem Cyberangriff auf die Berliner Verwaltung stammte. Wir hatten damals auf eine Meldung verzichtet, weil ein geleaktes Vergabedokument allein noch keinen Beschluss belegt. Diese Lage hat sich jetzt geändert. Was KI-Videoanalyse technisch überhaupt leistet, haben wir in unserer Reportage vom 12. September am Bremer Fall durchgearbeitet.

Der Kern der Antwort, wörtlich. Als Rechtsgrundlage nennt der Senat § 42d ASOG Berlin, der die Weiterverarbeitung personenbezogener Daten zum Training und Testen von KI-Systemen erlaubt. Für das Nachtraining mit echten Aufnahmen heißt es dann: „Hierfür werden zuvor wirksam bzw. irreversibel anonymisierte Datenbestände verwendet, bei denen eine Reidentifizierung natürlicher Personen durch die Verwendung etablierter Anonymisierungsverfahren ausgeschlossen ist, es sei denn, eine Anonymisierung steht den Zwecken der Testung oder des Trainings entgegen.“

Der Satz ist zweimal zu lesen. Der Hauptsatz verspricht irreversible Anonymisierung. Der Nebensatz am Ende hebt sie für den Fall auf, dass sie dem Trainingszweck entgegensteht. Wer den Zweck definiert, definiert damit die Ausnahme — und bei einem System, das Gewalt-, Sturz- und Liegesituationen an Menschen erkennen soll, ist gut vorstellbar, dass unkenntlich gemachte Körper genau dafür untauglich sind. Das ist der eigentliche Fund des Tages.

Was der Senat gleichzeitig zusichert, muss man ebenso genau wiedergeben, weil die Schlagzeile hier über das Dokument hinausgeht. Auf die Frage nach dem Zugriff des Auftragnehmers antwortet die Verwaltung: Das Nachtraining erfolge „ausschließlich auf Servern im Rechenzentrum der Polizei Berlin“, jeweils von der Polizei autorisiert, und „die Datenhoheit verbleibt uneingeschränkt bei der Polizei Berlin“. Wartungszugriffe liefen über protokollierte, einzeln freigegebene Fernwartungszugänge. Auf die Frage, ob eine kommerzielle Weiternutzung durch den Auftragnehmer ausgeschlossen sei, lautet die Antwort schlicht: „Ja.“

Auch die Zuschreibung der beteiligten Firma verdient Genauigkeit. Das Dokument nennt die Staige GmbH ausdrücklich als dasjenige Unternehmen, das das initiale Training durchgeführt hat — und zwar „ausschließlich mit synthetisch erzeugten Daten (keine Echt-Daten)“. Staige erscheint im Dokument also als Trainer mit Kunstdaten, nicht als Empfänger echter Aufnahmen. Wer das Nachtraining durchführt, bleibt im Text offen; er spricht nur vom „auftragnehmenden Unternehmen“. Die Rechte an den Vortrainingsdaten liegen laut Antwort beim Auftragnehmer.

Die beunruhigendste Angabe ist eine, die fast untergeht. Der Senat verweist an mehreren Stellen auf eine Verwaltungsvorschrift, die den Umgang mit Trainings- und Testdaten regeln soll. Diese Vorschrift existiert nach dem Wortlaut der Antwort noch nicht; sie ist erst zu erlassen. Die Zusicherungen zur Datenhoheit hängen damit an einem Regelwerk, das zum Zeitpunkt der Antwort nicht geschrieben war. Schrader kommentiert gegenüber netzpolitik.org: „Es ist erschreckend, wie gutgläubig der Senat die Tür zum KI-Einsatz bei der Polizei öffnet.“

Zur europarechtlichen Einordnung, die in der Debatte regelmäßig falsch läuft. Wir haben den Text der KI-Verordnung erneut geprüft: Das Verbot der Emotionserkennung in Artikel 5 gilt ausdrücklich nur am Arbeitsplatz und in Bildungseinrichtungen, nicht im öffentlichen Raum; biometrische Fernidentifizierung ist nicht vorgesehen, weil das System keine Gesichtserkennung einsetzt. Ebenso wenig ist die DSGVO hier das maßgebliche Regelwerk — Artikel 2 nimmt die Verarbeitung durch Behörden zur Gefahrenabwehr und Strafverfolgung ausdrücklich aus. Einschlägig ist die Richtlinie (EU) 2016/680, umgesetzt im Berliner Datenschutzgesetz, auf das die Senatsantwort folgerichtig auch verweist. Wer hier mit dem AI Act oder der DSGVO argumentiert, argumentiert am geltenden Recht vorbei.

Eine Einschränkung in eigener Sache: Zu diesem konkreten Vorgang haben wir trotz gezielter Suche keine zweite, unabhängige Berichterstattung gefunden; ältere Texte von taz, heise und nd behandeln frühere Stufen des Projekts. Das Dokument selbst ist über den offiziellen Parlamentsserver derzeit nicht abrufbar — wir haben die von netzpolitik.org veröffentlichte Fassung gelesen, deren Aufbau, Nummerierung und Zeichnung dem Format anderer Schriftlicher Anfragen entspricht.

Was daran über Berlin hinausweist: Die Konstruktion — Anonymisierung als Regel, Aufhebung der Regel, wenn sie den Zweck vereitelt — ist kein Berliner Sonderweg, sondern die übliche Formulierung, wenn eine Behörde echte Daten für maschinelles Lernen braucht. Wer in einem regulierten Umfeld ein Modell auf Personendaten nachtrainieren will, wird früher oder später vor demselben Satz stehen. Er ist praktikabel und er ist prüfbar — aber nur, wenn vorher festgelegt und protokolliert ist, wer den Trainingszweck definiert. Genau das steht in Berlin noch aus.

Reportage

Der Hebel liegt nicht in Brüssel: Warum in Deutschland der Betriebsrat über Ihren KI-Rollout entscheidet

Weiterlesen →

Tool-Radar

Neue und trendende KI-Tools des Tages

Cartesian Logo
Wandelt Textbeschreibungen, Skizzen oder Referenzbilder in editierbare 3D-Volumenmodelle im CAD-Format um.
Erzeugt statt der üblichen Polygonnetze native NURBS-Geometrie mit exakten Kanten, die sich direkt in Rhino oder SketchUp weiterbearbeiten lässt — genau daran scheitern bisherige KI-3D-Werkzeuge. Hinter dem Produkt steht mit Formas ein bestehendes Team aus der 3D-Visualisierung.
Kreativ · September 2026
Panel Logo
Lokale Forschungsoberfläche, in der ein KI-Agent neben eigenen Dateien, PDFs und Notebooks passende Ansichten selbst baut.
Statt eines festen Chatfensters bekommt der Agent ein Dock aus Bereichen und erzeugt einen neuen Betrachter, wenn kein eingebauter passt. Das Repository wurde am 15. September angelegt; als Agenten-Unterbau dient derzeit ausschließlich Claude Code.
Produktivität · September 2026
DaiDocs Logo
Offenes Klartext-Dateiformat, in dem KI-Assistenten ihr Langzeitgedächtnis lokal auf der Festplatte ablegen statt in einem fremden Dienst.
Die Dateien sind mit gewöhnlichen Suchwerkzeugen lesbar und laut Projektbeschreibung von Claude, GPT, Gemini, Cursor und lokalen Modellen gleichermaßen nutzbar; ein MCP-Server übernimmt die Anbindung. Die im Repository genannten Messwerte sind Eigenangaben und von uns nicht geprüft.
Dev-Tools · September 2026
Voiskey Logo
Diktierwerkzeug, das gesprochene, unsortierte Sprache in fertig formulierten Text für Nachrichten, E-Mails oder Prompts umsetzt.
Es entfernt Füllwörter, Versprecher und Gedankensprünge und passt den Ton an den Zielkontext an, statt nur zu transkribieren; unterstützt werden nach Herstellerangabe über 100 Sprachen. Product-Hunt-Start am 15. September auf Rang drei.
Produktivität · September 2026
Axari Logo
KI-Assistent für Sicherheitsteams, der Alarm-Sichtung, Compliance-Nachweise und Lieferantenprüfungen übernimmt.
Er arbeitet in vorhandenen Werkzeugen wie Slack, Jira oder Splunk, statt sie zu ersetzen, und verlangt für kritische Schritte eine menschliche Freigabe mit Prüfspur. Product-Hunt-Start am 15. September.
Business · September 2026
Anthropologic Logo
Marktforschungs-Plattform, die kulturelle Signale aus dem offenen Netz in Einschätzungen für Marken übersetzt.
Sie ordnet ein beliebiges Verhalten binnen Minuten kulturell ein und bietet synthetische Befragungen mit KI-erzeugten Zielgruppen als schnellere Alternative zur klassischen Umfrage. Neu ist das Produkt, nicht die Firma: Dahinter steht das 2018 gegründete Unternehmen Quilt.AI.
Business · September 2026

Aus der Werkstatt

YouTube-Empfehlungen: Tutorials, Erklärungen und Werkzeuge

How to Build Production AI Agents with Permissions and Scopes
Tutorial
Nicolai Nielsen · 15:15
Der praktische Gegenentwurf zur üblichen Agenten-Demo: Statt dem Agenten vollen Zugriff zu geben, baut Nielsen einen Reise-Assistenten mit Werkzeugzugriff und weist ihm feingranulare Berechtigungen und Scopes zu. Genau die Frage, an der Agentenprojekte beim Übergang in den Produktivbetrieb hängenbleiben — und die zu den Meldestellen in dieser Ausgabe passt. Der eingesetzte Berechtigungsdienst ist ein offengelegter Sponsor, der Kanal bewirbt zudem eigene Kurse.
Fine-Tune, Deploy & Serve Open LLMs with Crusoe Intelligence Foundry
Tutorial
Krish Naik · 44:28
Der komplette Weg vom Rohmodell zum produktiven Endpunkt, ohne eigene GPU-Verwaltung: Qwen3 8B wird auf einem synthetischen Datensatz mit Finanz-Personendaten feinabgestimmt, gegen Llama 3.3 70B verglichen und anschließend als Inferenzdienst bereitgestellt. Nützlich für alle, die abschätzen wollen, was ein eigenes Nachtraining tatsächlich an Arbeit bedeutet — die Frage, die auch hinter Salesforces Koa steht. Mit 44 Minuten das längste Video dieser Ausgabe; die genutzte Plattform ist ein offengelegter Sponsor.