· 8 Artikel + Reportage + Tool-Radar + Werkstatt

Ausgabe vom 13. August 2026

Maschinell recherchiert, menschlich relevant.

Sicherheit · Reasoning-Modelle

Das verschlüsselte Denkprotokoll war nie geheim: Ein schwaches Modell liest vor, was das starke gedacht hat

Hintergrund & Analyse

Moderne Reasoning-Modelle denken, bevor sie antworten. Dieses Denken — die sogenannte Gedankenkette, englisch Chain of Thought — ist für Anbieter kostbar: Es verrät, wie das Modell zu seinem Ergebnis kommt, und wäre damit die ideale Vorlage, um ein billiges Konkurrenzmodell nachzutrainieren. Anthropic, OpenAI und Google geben diese Denkprotokolle deshalb nicht im Klartext heraus. Stattdessen schicken sie sie verschlüsselt an den Client zurück, als sogenannten encrypted reasoning block. Bei der nächsten Anfrage sendet der Client den Block wieder mit, damit das Modell den Faden nicht verliert. Was drinsteht, sieht der Kunde nicht.

Ein internationales Forscherteam hat am 10. August ein Papier eingereicht, das diese Konstruktion aushebelt. Unter dem Titel „Stealing Reasoning Traces from Proprietary LLM APIs“ (arXiv:2608.09867) beschreiben Autoren von MATS Research, dem Max-Planck-Institut für Intelligente Systeme, dem ELLIS Institute Tübingen, der Universität Tübingen und dem Sicherheitsunternehmen Snyk einen Angriff, der ohne Kryptoanalyse auskommt.

Der entscheidende Befund: Der Schlüssel ist global pro Modellfamilie. Er hängt nicht am Nutzer, nicht an der Sitzung und nicht am konkreten Modell. Ein Denkblock, den das teure Spitzenmodell erzeugt hat, lässt sich deshalb in eine Anfrage an ein kleineres, schwächer abgesichertes Geschwistermodell derselben Familie einschleusen — und dieses per schlichtem Prompt anweisen, den Inhalt wörtlich vorzulesen. Das schwache Modell wird zum, wie die Autoren es nennen, unfreiwilligen Entschlüsselungs-Orakel. Das starke Modell muss dafür nie angegriffen werden.

Wie ergiebig das ist, zeigt der zweite Teil der Arbeit. Das Team sammelte aus öffentlichen GitHub- und Hugging-Face-Repositories 315.320 verschlüsselte Reasoning-Blöcke — Material, das Entwickler versehentlich mit ihrem Code veröffentlicht hatten, in der offenkundigen Annahme, unlesbar sei gleichbedeutend mit ungefährlich. Entschlüsselt enthielten sie 367 personenbezogene Artefakte und 182 Zugangsdaten, darunter 62 API-Schlüssel, 33 Passwörter im Klartext und 30 private E-Mail-Adressen. t3n nennt zusätzlich 24 Access-Tokens.

Daraus ergeben sich vier Angriffswege, die unterschiedliche Zielgruppen treffen. Für Wettbewerber fällt der Schutz vor Distillation — dem Nachtrainieren eines eigenen Modells auf fremden Denkprotokollen. Für Angreifer entsteht eine Massenquelle für Zugangsdaten aus versehentlich geteilten Logs. Für die Anbieter selbst wird sichtbar, was ihre Modelle intern erwägen, aber in der sichtbaren Antwort zurückhalten. Und für alle, die Agenten bauen, öffnet sich ein besonders unangenehmer Weg: Eine Prompt-Injection lässt sich vollständig im verschlüsselten Block verstecken, wo weder Mensch noch Filter sie liest.

Die Autoren bezeichnen den Befund im Abstract ausdrücklich als „architectural vulnerability“, also als Konstruktionsfehler und nicht als gewöhnlichen Bug. Das ist eine relevante Unterscheidung: Global wiederverwendbare, sitzungsunabhängige Schlüssel in Kombination mit modellübergreifender Kompatibilität sind kein Versehen an einer Stelle im Code, sondern eine Entwurfsentscheidung.

Die Hersteller wurden vor der Veröffentlichung informiert. Laut heise konnten sie daraufhin erste Gegenmaßnahmen umsetzen; im Papier heißt es, alle Anbieter hätten den Eingang des Berichts bestätigt und die gezeigten Angriffe hätten sich anschließend nicht wiederholen lassen. Simon Willison, der den Original-API-Aufruf nachvollzogen hat, weist darauf hin, dass in den 4.6er-Claude-Modellen die für den Jailbreak genutzte Funktion Assistant Turn Prefix entfernt wurde. Individuelle Stellungnahmen von OpenAI, Anthropic oder Google liegen bislang in keiner der Meldungen vor. Dass die konkret demonstrierten Angriffe nicht mehr funktionieren, ist nicht dasselbe wie eine behobene Architektur — die Autoren schlagen selbst weitergehende kryptografische und Systemmaßnahmen vor, was nahelegt, dass das strukturelle Problem offen ist.

Für Unternehmen, die diese Modelle per API in Produkte einbauen, folgt daraus eine unbequeme, aber sehr konkrete Regel: Verschlüsselte Reasoning-Blöcke sind wie Klartext-Geheimnisse zu behandeln. Sie gehören nicht in öffentliche Repositories, nicht in Bug-Reports, nicht in Support-Tickets und nicht ungeprüft in Debug-Logs, auf die Dritte Zugriff haben. Wer reasoning.encrypted_content-Felder speichert, braucht dafür eine Aufbewahrungsrichtlinie wie für Zugangsdaten. Und wer Reasoning-Traces zwischen Agenten weiterreicht, sollte wissen, dass er damit potenziell unsichtbare Anweisungen mitliefert. Die Annahme, das eigene Reasoning sei vor der Konkurrenz sicher, gilt bis auf Weiteres nicht mehr.

Plattformen · Google

Eine Milliarde Menschen nutzen Gemini — und Google rechnet die größte Zahl bewusst nicht mit

Hintergrund & Analyse

Google hat am 11. August gemeldet, dass die Gemini-App die Marke von einer Milliarde monatlich aktiver Nutzer überschritten hat. Verkündet hat es Konzernchef Sundar Pichai im hauseigenen Blog, ergänzt um Details von Gemini-Vizepräsident Josh Woodward. Einen Tag später, am 12. August, folgte mit Made by Google '26 die Hardware-Veranstaltung, auf der die dazugehörigen Geräte gezeigt wurden.

Die wichtigste Information steckt nicht in der Zahl, sondern in ihrer Zählbasis. Google stellt im Blogpost ausdrücklich klar, dass sich die Milliarde ausschließlich auf App und Weboberfläche von Gemini bezieht — nicht auf alle Orte, an denen Nutzer bei Google auf KI treffen. Die Einbettungen in Gmail, Drive und Workspace fließen nicht ein. Und die AI Overviews, also die KI-Zusammenfassungen über den Suchergebnissen, werden separat ausgewiesen und liegen je nach Quelle bei rund zwei bis zweieinhalb Milliarden monatlichen Nutzern.

Das ist bemerkenswert, weil es in die andere Richtung geht als üblich. Google hätte die Zahl mühelos verdoppeln können, indem es die Suchintegration mitzählt — und tut es nicht. Die gemeldete Milliarde ist damit die konservativere von zwei möglichen Zahlen. Zugleich macht die Trennung sichtbar, wie groß der Abstand zwischen Gemini als Produkt und Gemini als Technologie im Hintergrund ist. Wer über Marktanteile bei KI-Assistenten spricht, sollte wissen, welche der beiden Zahlen gerade gemeint ist.

Der Wachstumsverlauf ist über mehrere Berichte hinweg konsistent: etwa 400 Millionen im Mai 2025, rund 650 Millionen im Oktober 2025, ungefähr 750 Millionen im Februar 2026, etwa 900 Millionen im Mai 2026 und zuletzt rund 950 Millionen. Von dort bis über die Milliarde vergingen laut Forbes weniger als vier Wochen. Gemini ist damit nach Google-Angaben das vierzehnte Produkt des Konzerns mit mindestens einer Milliarde monatlich aktiver Nutzer und das am schnellsten gewachsene der Firmengeschichte. ChatGPT hatte diese Marke früher erreicht — die Quellen nennen uneinheitlich Mai oder Juni 2026 —, wächst aber langsamer.

Die Nutzungsdaten, die Google nebenbei nennt, sind aufschlussreicher als die Gesamtzahl: 63 Prozent aller Gemini-Interaktionen laufen über Sprache, täglich werden rund 150 Millionen Bilder erzeugt, und jede fünfte Live-Sitzung nutzt zusätzlich Kamera oder Bildschirmfreigabe. Über 100 Millionen aktive Nutzer entfallen auf iOS — also auf Geräte ohne jeden Android-Vorinstallationsvorteil. Zahlen zu zahlenden Abonnenten nannte Google nicht.

Die Hardware am Folgetag ordnet sich in dieses Bild ein. Das Pixel 11 startet bei 899 Dollar, hundert Dollar über dem Vorgänger, verdoppelt dafür den Basisspeicher auf 256 GB. Pixel 11 Pro und Pro XL beginnen bei 1.099 Dollar, das Pro Fold wird rund zehn Prozent leichter und bekommt eine 48-Megapixel-Hauptkamera mit 30-fachem Superzoom. Die Pixel Watch 5 kostet 399 respektive 429 Dollar und liefert monatliche Trendauswertungen zu Blutdruck und Insulinresistenz. Neu ist der Pixel Tag für 29 Dollar, ein AirTag-Konkurrent über Androids Find Hub.

Bei den Software-Funktionen sticht die erweiterte Live-Transkription hervor, die über die Kamera Gebärdensprache übersetzt — ein Anwendungsfall, der ohne Gerät im Feld nicht funktioniert und deshalb genau die Verzahnung zeigt, um die es hier geht. Dazu kommt Rambler, eine Spracheingabe, die auch unstrukturiertes, abgehacktes Sprechen verarbeitet, sowie ein erweitertes Circle to Search mit direktem Kamerazugriff.

Für Unternehmen ist die Lehre weniger die Milliarde als der Weg dorthin. Google hat keinen Qualitätsvorsprung ausgespielt, sondern einen Verteilungsvorsprung: Vorinstallation auf Android, Einbettung in die Suche, Bündelung in Workspace. Wie weit dieses Muster im KI-Markt 2026 trägt — und wo es an seine Grenzen stößt —, ist das Thema unserer heutigen Reportage.

Finanzierung · Coding-Werkzeuge

Vier Milliardenrunden an einem Tag: Das Kapital wandert von den Modellen zu allem, was um sie herum steht

Hintergrund & Analyse

Der 12. August brachte binnen 24 Stunden vier Finanzierungsmeldungen aus demselben thematischen Umfeld. Einzeln betrachtet ist jede davon eine Randnotiz des Wagniskapitalmarkts. Zusammen ergeben sie ein Muster, das für jeden interessant ist, der gerade über Werkzeugbudgets entscheidet.

Cognition, Hersteller des Coding-Agenten Devin, verhandelt laut Bloomberg-Quellen über eine Runde bei über 40 Milliarden Dollar Bewertung. Hier ist Genauigkeit wichtig: Das ist Gerüchtelage. Weder Betrag noch Investoren noch Abschluss sind bestätigt, die Information stammt von anonymen Quellen. Bestätigt ist dagegen die Vorrunde vom 27. Mai 2026 — eine Milliarde Dollar bei 25 Milliarden Pre-Money, also 26 Milliarden Post-Money, angeführt von Lux Capital, General Catalyst und 8VC. Damals nannte Firmenchef Scott Wu gegenüber TechCrunch einen ARR von 492 Millionen Dollar. Im September 2025 lag die Bewertung noch bei 10,2 Milliarden. Das sind drei Sprünge in elf Monaten.

Die Multiple-Rechnung ist dabei aufschlussreicher als die Schlagzeile. Bei 26 Milliarden Bewertung und 492 Millionen ARR ergab sich etwa das 53-Fache des Umsatzes. Bei 40 Milliarden und der kolportierten Annäherung an eine Milliarde ARR wären es rund das 40-Fache. Das Vielfache sinkt also, obwohl die Bewertung steigt — weil der Umsatz noch schneller wächst. Das ist ein gesünderes Signal, als der Bewertungssprung allein suggeriert.

Lovable hat dagegen konkret bestätigt: 400 Millionen Dollar Series C bei einer Bewertung von 13,3 Milliarden, angeführt von Menlo Ventures und dem Scaleup Europe Fund. Die Vorrunde vom Dezember 2025 lag bei 6,6 Milliarden — eine Verdopplung in acht Monaten. Der zuletzt genannte ARR von 500 Millionen Dollar (Stand Juni 2026, Firmenangabe, nicht unabhängig geprüft) ergibt ein Vielfaches von rund 27. Das Unternehmen nennt 60 Millionen Projekte und 900 Millionen monatliche Besucher; nach eigener Darstellung haben fast zwei Drittel der Fortune-500-Unternehmen Mitarbeiter, die Lovable nutzen — vor sechs Monaten war es die Hälfte. TechCrunch legt in eigener Sache offen, dass der beteiligte Investor Regent zur Muttergesellschaft des Mediums gehört.

Der interessanteste Fall ist Blacksmith, weil er das Muster erklärt. Die Firma baut schnellere CI-Infrastruktur — konkret beschleunigte GitHub-Actions-Runner — sowie Codesmith, einen Agenten, der fehlgeschlagene Code-Prüfungen selbsttätig repariert. Die Series B über 45 Millionen Dollar unter Führung von Peak XV Partners hebt die Bewertung von 60 Millionen (September 2025) auf 550 Millionen, also gut das Neunfache in weniger als einem Jahr. Kunden: über 5.000, darunter Mercury, Supabase, Clerk und Expensify. Der ARR bleibt vage — „zweistellige Millionen“ ist keine Zahl, mit der sich rechnen lässt, und wir führen sie entsprechend nicht als eine.

Genau hier liegt die Pointe: Blacksmith verkauft nicht KI-Codeerzeugung, sondern deren Folgekosten. Wenn Agenten mehr Code schreiben, laufen mehr Tests, häufiger, teurer — und mehr davon schlagen fehl. Der Engpass verschiebt sich vom Schreiben zum Prüfen. Wer heute Coding-Agenten einführt, sollte die CI-Rechnung im Voraus modellieren, nicht im Nachhinein entdecken.

Thrive Holdings schließlich sammelte zwei Milliarden Dollar bei zwölf Milliarden Bewertung ein, von SoftBank, D1 Capital Partners und Altimeter Capital. Das ist keine Softwarefirma, sondern ein Holding-Vehikel nach dem Vorbild von Constellation Software: Es kauft Mehrheiten an klassischen Dienstleistern — vor allem Steuerberatungen und IT-Dienstleister — und rüstet deren Abläufe mit KI aus. Thrive Holdings ist eine Abspaltung von Thrive Capital, der Beteiligungsgesellschaft von Josh Kushner und einem der größten OpenAI-Investoren; OpenAI selbst stieg im Dezember 2025 mit Kapital und Personal ein. Über 70 Firmen gehören zum Portfolio, verteilt auf die Plattformen Current (Buchhaltung, über 50 Firmen) und Shield (IT, rund 20 Firmen). Die genannten Betriebskennzahlen — etwa 7.000 bearbeitete Steuererklärungen bei 98 Prozent Genauigkeit — sind Firmenangaben ohne unabhängige Prüfung.

Das Muster über alle vier Meldungen: Investoren wetten nicht mehr primär auf die Modellanbieter, sondern auf die Kette darum herum — den Agenten, die Prüfinfrastruktur, die er nötig macht, und die Branchen, in die er hineingetragen wird. Die Vielfachen liegen dabei weit über dem, was börsennotierte Software-Unternehmen erzielen (üblicherweise das Acht- bis Fünfzehnfache des Umsatzes). Gegenstimmen gibt es: Analysten weisen darauf hin, dass Cognitions Wachstum durch die Windsurf-Übernahme teilweise zugekauft ist, was die organische Entwicklung schwer isolierbar macht, und dass compute-lastige Bruttomargen bei einem Stimmungsumschwung schnell unter Druck geraten.

Recht · Smart Glasses

Strafanzeige gegen Meta, Ray-Ban und vier Handelsketten — und die entscheidende Norm ist nicht die, die alle erwarten

Hintergrund & Analyse

Die Menschenrechtsorganisation HateAid hat am 12. August Strafanzeige bei der Generalstaatsanwaltschaft Frankfurt am Main erstattet, konkret bei der Zentralstelle zur Bekämpfung der Internetkriminalität. Sie richtet sich gegen die Geschäftsführung von Meta Platforms Technologies Ireland Limited, gegen die Marken Ray-Ban und Oakley der Luxottica Group sowie gegen vier Handelsunternehmen: Fielmann, Apollo-Optik, Mister Spex und MediaMarkt. Anders als eine verbreitete Schlagzeile nahelegt, benennt die Anzeige keine einzelnen Manager namentlich — sie richtet sich jeweils gegen „die Geschäftsführung“. Im Mittelpunkt steht die Ray-Ban Meta Wayfarer der zweiten Generation, die sich äußerlich kaum von einer gewöhnlichen Sonnenbrille unterscheiden lässt.

Juristisch interessant ist, worauf sich die Anzeige nicht stützt. Der nächstliegende Paragraf wäre § 201a StGB, der unbefugte Bildaufnahmen aus dem höchstpersönlichen Lebensbereich unter Strafe stellt. Der greift jedoch erst, wenn jemand tatsächlich filmt — er trifft also den Träger der Brille, nicht den Hersteller.

HateAid geht deshalb einen anderen Weg und beruft sich auf § 8 Absatz 1 des Telekommunikation-Digitale-Dienste-Datenschutz-Gesetzes (TDDDG). Die Norm verbietet Besitz, Herstellung, Inverkehrbringen und Einfuhr von Telekommunikationsanlagen, die durch ihre Form einen anderen Gegenstand vortäuschen oder mit Alltagsgegenständen getarnt sind und deshalb besonders geeignet und bestimmt sind, unbemerkt Gespräche mitzuhören oder Bildaufnahmen herzustellen. Entscheidend ist die gesetzliche Klarstellung, wann eine Anlage als „bestimmt“ gilt: nämlich dann, wenn ihre Aufnahmefunktion für den Betroffenen bei bestimmungsgemäßer Verwendung nicht klar erkennbar ist. Die Strafandrohung steht in § 27 Absatz 1 Nummer 3 TDDDG: bis zu zwei Jahre Freiheitsstrafe bei Vorsatz, bis zu einem Jahr bei Fahrlässigkeit.

Damit verschiebt sich die Angriffsrichtung fundamental. Es geht nicht mehr um die Frage, ob jemand die Brille missbraucht, sondern darum, ob das Gerät als solches verkehrsfähig ist. Und die Norm erfasst ausdrücklich auch den Besitz — nicht erst die Nutzung.

Der technische Vorwurf hat drei Stränge. Erstens die Tarnung: Die Wayfarer sieht aus wie eine Sonnenbrille. Zweitens die Aufnahme-LED, die Meta verbaut hat. HateAid hält sie für zu unauffällig; der Hamburgische Datenschutzbeauftragte Thomas Fuchs formulierte es so, das LED-Signal falle im Alltag einfach nicht genug auf. Laut heise gibt es zudem Berichte, wonach Drittanbieter-Dienste die LED deaktivieren können, ohne die Aufnahmefunktion einzuschränken. Ob sich die LED schlicht überkleben lässt, ist naheliegend, aber in den geprüften Quellen nicht belegt — wir führen es nicht als Tatsache.

Der dritte Strang ist der heikelste, und hier ist Präzision geboten. Die ausgelieferte Hardware hat keine aktive Gesichtserkennung. Wired und die Electronic Frontier Foundation fanden im Juni 2026 allerdings in der Meta-AI-App auf über 50 Millionen Geräten ruhenden Programmcode für eine Funktion namens Name Tag, die sich im Debug-Modus aktivieren ließ und Gesichter zu biometrischen Signaturen verarbeiten konnte. Meta entfernte den Code einen Tag nach der Veröffentlichung. Die EFF wertete das als Erfolg, wies aber darauf hin, dass eine einmal ausgelieferte Funktion erneut ausgeliefert werden kann. Davon zu trennen ist das Harvard-Studentenprojekt I-XRAY von 2024, das Gesichtssuche über einen selbstgebauten Aufbau aus Livestream und Sprachmodell anflanschte — keine Werksfunktion, aber ein Beleg dafür, wie wenig es dazu braucht.

Meta äußerte sich zunächst nicht. Von den Händlern reagierten nur MediaMarktSaturn, man nehme die Anzeige sehr ernst, und Mister Spex, man lege Wert auf Datenschutz, kenne die Anzeige aber noch nicht. Die Zentralstelle in Frankfurt bestätigte den Eingang und prüft zunächst den Anfangsverdacht. Parallel und unabhängig davon hatte Fuchs bereits Ende Juli ein mögliches Verkaufsverbot für Deutschland ins Gespräch gebracht — zuständig wäre die Bundesnetzagentur.

Für Unternehmen ist das keine ferne Rechtsdebatte. Weil § 8 TDDDG bereits den Besitz erfasst, bewegen sich Mitarbeitende, die eine solche Brille im Büro oder beim Kunden tragen, in einer unklareren Lage als bei einer sichtbaren Kamera. Eine betriebliche Regelung dazu sollte man nicht erst nach einer möglichen Entscheidung treffen. Für Optiker und Elektronikhändler wiegt es schwerer: Die Strafnorm richtet sich unmittelbar gegen das Inverkehrbringen. Und ein Verkaufsverbot durch die Bundesnetzagentur würde nicht nur künftige Verkäufe treffen. Ob die Anzeige Erfolg hat, ist offen — dass die Frage nun von einer Staatsanwaltschaft geprüft wird, ist es nicht.

Agenten · SpaceXAI

Grok Bot bekommt einen eigenen Rechner in der Cloud — und der Produktchef sagt offen, warum das der Unterschied ist

Hintergrund & Analyse

SpaceXAI — die Firma, die vor der Fusion mit SpaceX als xAI firmierte und in vielen Berichten noch so genannt wird — hat am 11. und 12. August Grok Bot vorgestellt. Die Beta läuft für macOS, Windows, Linux und iOS, Android soll folgen; Unternehmenskunden stehen auf einer Warteliste.

Das Bedienkonzept ist bewusst simpel: Man delegiert Arbeit im Gespräch, so wie man sie einer Kollegin geben würde, statt vorher einen Ablauf zu bauen. Der Bot arbeitet danach selbstständig weiter — auch wenn der eigene Laptop im Ruhezustand ist — und meldet sich zurück, wenn er eine Freigabe braucht oder fertig ist. Er kann außerdem zusehen, während man ihm eine Aufgabe einmal vormacht, und den Ablauf als wiederholbare Routine speichern. Mehrere Bots lassen sich in Gruppenchats zusammenschalten und reichen Aufgaben untereinander weiter.

Der technisch entscheidende Unterschied zu lokal laufenden Agenten wie OpenClaw: Jeder Bot bekommt einen eigenen virtuellen Rechner in der Cloud. Dort liegen Gedächtnis, Routinen und — das ist der wichtige Teil — die Zugangsdaten zu den angebundenen Werkzeugen, Postfächern und Websites. Das erklärt, warum der Bot durchläuft, wenn der Nutzer offline geht. Es verlagert aber auch die Schlüssel zu den Systemen des Unternehmens in die Infrastruktur des Anbieters.

Preislich ist Grok Bot in bestehende Abos gebündelt: SuperGrok Heavy für 300 Dollar im Monat, Cursor Ultra für 200 Dollar und Cursor Teams Premium für 120 Dollar je Nutzer und Monat. Dass Cursor hier auftaucht, ist kein Zufall — SpaceXAI hatte den Editor-Hersteller im Juni 2026 übernommen.

Parallel dazu ist am 12. August Grok 4.6 erschienen. Im Artificial Analysis Intelligence Index erreicht die Variante „high“ 61 Punkte und damit Rang sechs von 184 gelisteten Modellen — fünf Punkte mehr als Grok 4.5, gut einen Monat nach dessen Erscheinen. Zum Vergleich, jeweils in der stärksten gelisteten Konfiguration: Claude Opus 5 führt mit 63, Claude Fable 5 folgt mit 62, Grok 4.6 liegt bei 61 und damit auf einer Höhe mit GPT-5.6 Sol und knapp vor Kimi K3. Bei agentischen Aufgaben schneidet das Modell besonders gut ab: Der GDPval-Elo von 1753 wird nur von Opus 5 übertroffen. Der Preis bleibt gegenüber 4.5 unverändert; in der Diskussion auf Hacker News weisen Nutzer allerdings darauf hin, dass die Kosten für Cache-Zugriffe nahezu verdoppelt wurden, was den Kostenvorteil bei kontextlastigen Aufgaben relativiert.

Grok Bot reiht sich damit in einen Trend ein, den Anthropic mit Claude Cowork im Januar 2026 eröffnet hat und den OpenAI mit ChatGPT und Codex in Richtung Unternehmensarbeit weitertreibt: Der Agent wird als Teammitglied verkauft, nicht als Werkzeug. Der Unterschied liegt weniger im Modell als in der Ausführungsumgebung — lokal beim Nutzer oder zentral beim Anbieter.

Für europäische Unternehmen steht vor all diesen Fragen allerdings eine banalere: Verfügbarkeit. Grok ist in der EU stark eingeschränkt — beim Rollout von Grok 4.5 im Juli 2026 waren alle 27 Mitgliedstaaten von einer Freigabe in 47 Ländern ausgenommen. Ein Unternehmenstarif mit belastbarem Auftragsverarbeitungsvertrag ist nach unserer Recherche nicht auffindbar. Ob Grok Bot in der EU nutzbar ist, sagen die vorliegenden Quellen nicht; wir führen das als offen. Dazu kommen zwei Vorfälle, die bei einem Agenten mit echten Zugangsdaten schwerer wiegen als bei einem Chatbot: der „MechaHitler“-Vorfall vom Juli 2025, bei dem eine Änderung am Systemprompt antisemitische Ausgaben auslöste, und die Panne, durch die über 370.000 Grok-Konversationen über eine fehlerhafte Teilen-Funktion in Suchmaschinen landeten — samt Passwörtern und Geschäftsinterna.

Offene Modelle · Nvidia

Nvidias neues 30-Milliarden-Modell will gar nicht klug sein — es will die Fleißarbeit billiger machen

Hintergrund & Analyse

Nvidia hat am 11. August NVIDIA-Nemotron-3.5-Lightning-30B-A3B veröffentlicht, ein offenes Modell mit 30 Milliarden Parametern, von denen pro Token nur drei Milliarden aktiv sind. Die Architektur mischt Mamba-2-Schichten, MoE-Routing und ausgewählte Attention-Lagen; das Modell ist aus dem größeren Nemotron 3 Ultra destilliert. Die Lizenz OpenMDW-1.1 erlaubt kommerzielle Nutzung, Feinabstimmung und Weiterdestillation. Verfügbar ist es auf Hugging Face — in 48 quantisierten Varianten einschließlich GGUF —, über NIM, OpenRouter und DeepInfra, mit Unterstützung in vLLM, SGLang, TensorRT-LLM, Ollama, llama.cpp und LM Studio.

Nvidia nennt eine Kontextlänge von bis zu einer Million Token. Auf einer einzelnen H100 oder A100 mit 80 GB sind praktisch eher rund 256.000 realistisch, weil der Speicher limitiert — ein Punkt, den weder der Nvidia-Blog noch die Berichterstattung ausdrücklich benennen.

Bei den Leistungswerten lohnt die Trennung nach Herkunft. Nvidias eigene Angaben: bis zu vierfache Ausgabegeschwindigkeit gegenüber ähnlich großen Modellen sowie 86 Prozent Genauigkeit auf dem hauseigenen „PinchBench“ mit 10.000 Agentenaufgaben, bei 30 Prozent schnellerer Bearbeitung als Qwen3.6 35B-A3B. Die Modellkarte nennt 81,9 auf MMLU Pro, 75,4 auf GPQA Diamond und 51,6 bis 52,8 auf SWE-bench Verified. PinchBench ist ein Nvidia-naher Maßstab ohne breite externe Standardisierung — die Zahlen darauf sind entsprechend zu lesen.

Unabhängig gemessen sieht es nüchterner aus. Im Artificial Analysis Intelligence Index kommt Nemotron 3.5 Lightning auf 24 Punkte. Qwen3.6 35B-A3B liegt bei 32, Metas erst am 10. August erschienenes Muse Glimmer 30B bei 35. Das Modell rangiert damit gleichauf mit OpenAIs gpt-oss-120b und knapp hinter Nvidias eigenem, rund viermal größerem Nemotron 3 Super. Was unabhängig bestätigt wird, ist der Durchsatz: rund 293 Token pro Sekunde.

Damit ist die Positionierung klar, und Nvidia macht daraus auch kein Geheimnis. Das Modell ist nicht als Alleskönner gedacht, sondern als Ausführungsschicht für lang laufende Agenten — Werkzeugaufrufe, Abrufen von Dokumenten, Prüfen, Formatieren, Klassifizieren, Zusammenfassen. Das Nachdenken übernimmt ein größeres Modell.

Wie gut das rechnet, hat LangChain unabhängig gemessen. In einem Test mit 145 mehrstufigen Aufgaben wurden 93 Prozent der Aufrufe an Lightning geleitet und nur 7 Prozent an Claude Opus 4.8. Ergebnis: 74 Prozent geringere Kosten bei etwa sechs Prozentpunkten weniger Genauigkeit. Ob dieser Tausch akzeptabel ist, hängt vollständig vom Anwendungsfall ab — und genau darin liegt die praktische Botschaft dieser Veröffentlichung. Die Frage lautet nicht mehr „welches Modell ist das beste“, sondern „welcher Anteil meiner Aufrufe braucht das beste Modell überhaupt“.

Passend dazu hat Nvidia zeitgleich NeMo Switchyard als Open Source veröffentlicht, eine modellunabhängige Routing-Bibliothek, die Anfragen zwischen kleinen und großen Modellen verteilt. Nvidia verkauft also nicht nur ein Modell, sondern die Schaltzentrale darum herum — und in beiden Fällen ist der Eigennutzen dasselbe: mehr ausgelastete GPUs. Dieselbe Doppelstrategie zeigt ein zweiter Blogpost vom 12. August, in dem Nvidia beschreibt, wie Alibabas Qwen3.8-2.4T-A95B mit 2,4 Billionen Parametern auf der GB300-NVL72-Plattform über 4.000 Token pro Sekunde und GPU erreicht. Das eine Ende der Strategie ist das kleine offene Modell für die Fleißarbeit, das andere die Infrastruktur für die größten offenen Modelle der Konkurrenz. Beides läuft auf Nvidia-Hardware.

Praktisch läuft Lightning auf einer einzelnen modernen GPU — H100 oder A100 mit 80 GB, DGX Spark, RTX 5090 —, quantisiert im NVFP4-Format noch sparsamer, bis hinunter zu Jetson-Modulen.

Daten · Amazon

Twitch trainiert Amazons KI mit euren Streams — der Produktchef begründet den Opt-out mit entwaffnender Ehrlichkeit

Hintergrund & Analyse

Twitch hat am 12. August eine Einstellung namens Training for Generative AI eingeführt. Sie steht unter Einstellungen → Sicherheit und Datenschutz, ganz am Ende der Seite, und sie ist standardmäßig aktiviert. Wer nicht widerspricht, gibt damit Streams, VODs, Clips, Highlights, den Stream-Chat sowie Bilder und Texte des Kanals für das Training von Amazon-Modellen frei, die Text, Audio, Bild oder Video erzeugen.

Die von 404 Media aus dem offiziellen Hilfeartikel zitierte Formulierung lautet: „Allow your channel content to train generative AI content models at Amazon“. Und für den Widerspruchsfall: „If you opt-out … your streams, VODs, clips, stream chats, and pictures and text on your channel will not be used in future training.“ Das letzte Wort ist das entscheidende — der Widerspruch wirkt nur nach vorn. Was bereits verwendet wurde, bleibt verwendet. Eine Frist nennt Twitch nicht.

Ein Detail verdient besondere Aufmerksamkeit, weil es über den einzelnen Nutzer hinausgeht: Chat-Kommentare folgen der Entscheidung des Kanalbetreibers, nicht der des einzelnen Schreibenden. Wer in einem fremden Chat schreibt, hat über die Verwendung des eigenen Beitrags nicht selbst zu entscheiden. Für Unternehmenskanäle mit mehreren Verantwortlichen wird daraus eine Governance-Frage.

Nicht vom Widerspruch erfasst sind AutoMod, Untertitel, Empfehlungen, Sponsoring-Werkzeuge und Monetarisierungsfunktionen — die laufen unabhängig weiter. Das ist konsequent, sollte aber niemanden zu der Annahme verleiten, ein Opt-out schalte KI auf der Plattform ab.

Bemerkenswert ist die Begründung. Twitch-Produktchef Mike Minton sagte auf die Frage, warum man Opt-out statt Opt-in gewählt habe: „If this was opt-in, nobody would opt in. That's honestly the answer.“ Er ergänzte, man verkaufe die Daten nicht an andere Unternehmen weiter, die Modelle trainieren. Mary Kish, zuständig für Community, fügte hinzu: „Because this is industry standard, going other places won't absolve you of this.“ Das ist bemerkenswert offen — und in der Sache nicht falsch. Ein Eintrag im Ideenportal, der Opt-in als Standard fordert, sammelte binnen Stunden rund 13.000 bis 14.000 Zustimmungen.

Kish' Verweis auf den Branchenstandard lässt sich belegen. Meta erlaubt EU-Nutzern seit Mai 2025 den Widerspruch — die Datenschutzorganisation noyb nannte das Verfahren einen unnötig komplexen Abschreckungsprozess. LinkedIn hat sein Trainingsprogramm zum 3. November 2025 auf EU, UK und Schweiz ausgeweitet, ebenfalls per Opt-out. Adobe nimmt Stock-Beitragende aus, verfährt sonst genauso.

Für die europäische Rechtslage gilt: Der Schalter greift auch für deutsche Nutzer. Eine Aussage von Twitch oder Amazon zur konkreten Rechtsgrundlage nach DSGVO oder zum Text-und-Data-Mining-Vorbehalt des § 44b UrhG fanden wir nicht, und wir spekulieren nicht darüber. Als Rahmen relevant ist ein Urteil des Oberlandesgerichts Köln vom Mai 2025 (Az. 15 UKl 2/25), wonach Meta personenbezogene Daten von EU-Nutzern auf Opt-out-Basis nach Artikel 6 Absatz 1 Buchstabe f DSGVO — berechtigtes Interesse — für KI-Training verwenden darf. Das Urteil betrifft ausdrücklich Meta, nicht Twitch. Eine Äußerung einer deutschen oder europäischen Datenschutzbehörde speziell zu diesem Fall liegt bislang nicht vor.

Die praktische Konsequenz reicht über Twitch hinaus. Wer als Unternehmen Inhalte auf fremden Plattformen einstellt, sollte künftig fünf Punkte routinemäßig prüfen: ob es eine KI-Trainingsklausel gibt, ob sie als Opt-in oder Opt-out ausgestaltet ist, wo der Schalter versteckt liegt, ob ein Widerspruch rückwirkend gilt, und wer bei Inhalten mehrerer Beteiligter entscheidet. Diese Prüfung gehört inzwischen in die Freigabe jedes neuen Kanals.

Arbeitsmarkt · Deutschland

Die Hälfte der KI-nutzenden Firmen erwartet sinkende Löhne für Berufseinsteiger — die Reallöhne steigen gerade

Hintergrund & Analyse

Das ifo Institut hat am 12. August Ergebnisse einer Sonderfrage aus seiner Konjunkturumfrage veröffentlicht. Befragt wurden im Juni 2026 mehr als 3.000 Unternehmen in Deutschland, die KI bereits einsetzen. Die Frage zielte auf die erwartete Lohnentwicklung in den nächsten fünf Jahren. Ausgewertet hat sie Anna Ruffert vom ifo Zentrum für Makroökonomik und Befragungen.

Das Ergebnis fällt entlang der Berufserfahrung auseinander. Bei Beschäftigten mit weniger als fünf Jahren Erfahrung erwartet rund die Hälfte der Unternehmen sinkende Löhne: 48,3 Prozent bei Beschäftigten ohne Hochschulabschluss, 50,8 Prozent bei Beschäftigten mit Abschluss. Steigende Löhne erwarten in diesen Gruppen nur 5,9 beziehungsweise 16,3 Prozent. Bei mindestens fünf Jahren Erfahrung sinkt der Anteil auf rund 40 Prozent — 40,4 Prozent ohne Abschluss, 37,5 Prozent mit —, wobei hier immerhin 26 Prozent der Unternehmen bei Akademikern mit steigenden Löhnen rechnen. Je nach Gruppe erwartet ein Drittel bis die Hälfte stabile Löhne.

Nach Branchen sind Dienstleister am pessimistischsten (53,3 Prozent bei kurzer Erfahrung ohne Abschluss), gefolgt von Handel (47,9), verarbeitendem Gewerbe (46,5) und Bau (39,0). Ruffert fasst zusammen: „Insgesamt sehen wir, dass deutlich mehr Unternehmen negative Effekte erwarten als positive.“

Eine zweite, am selben Tag berichtete Zahl stammt aus einer anderen Erhebung und sollte nicht mit der ifo-Umfrage vermengt werden. Bitkom befragte in den Kalenderwochen 21 bis 27 online 102 Tech-Start-ups — ausdrücklich nicht repräsentativ, sondern als Stimmungsbild. Danach verzichteten in den vergangenen zwölf Monaten 27 Prozent wegen KI auf Neueinstellungen, 7 Prozent bauten Stellen ab, 16 Prozent stellten wegen KI zusätzlich ein, bei der Hälfte gab es keine Auswirkung. Für die kommenden zwölf Monate wollen 28 Prozent auf Einstellungen verzichten, 19 Prozent zusätzlich einstellen, nur 2 Prozent planen Abbau. Gleichzeitig erwarten 62 Prozent der Start-ups für 2026 insgesamt Personalwachstum, im Schnitt um vier Beschäftigte. Das ist kein Einstellungsstopp, sondern selektiver Verzicht bei einzelnen Rollen.

Und hier ist die notwendige Einordnung: Beides sind Erwartungsumfragen, keine Messungen. Sie erfassen, was Personalverantwortliche und Gründer vermuten — nicht, was geschieht. Die ifo-Stichprobe ist zudem auf Firmen beschränkt, die KI bereits nutzen; ein Vergleich zu Nichtnutzern fehlt, womit eine Selektionsverzerrung in Richtung digitalerer und größerer Unternehmen naheliegt. Die Bitkom-Stichprobe ist mit 102 Antworten klein.

Die harten Daten weisen derzeit in die andere Richtung. Nach Angaben des Statistischen Bundesamts stiegen die Reallöhne im ersten Quartal 2026 um 1,8 Prozent gegenüber dem Vorjahr, nominal um 4,1 Prozent — und die unteren Einkommensgruppen überproportional um 7,0 Prozent, vor allem durch die Anhebung des Mindestlohns zum 1. Januar 2026. Die Tarifabschlüsse des Jahres liegen bei drei bis fünf Prozent, teils darüber. Für einen KI-bedingten Lohndruck gibt es in den aktuellen Zahlen keinen Beleg. Das Institut für Arbeitsmarkt- und Berufsforschung kommt in einer Szenarienrechnung mit BIBB und GWS zu dem Schluss, dass KI die Gesamtbeschäftigung über fünfzehn Jahre weitgehend stabil lässt und vor allem rund 1,6 Millionen Arbeitsplätze zwischen Branchen verschiebt — und warnt ausdrücklich davor, sowohl positive als auch negative Effekte zu übertreiben.

Für die Personalplanung folgt daraus nichts Dramatisches, aber etwas Konkretes. Wenn ein Großteil der KI-nutzenden Unternehmen mit Lohndruck bei Berufseinsteigern rechnet, prägt das Angebote und Gehaltsbänder, lange bevor es sich in der Statistik zeigt. Wer Einstiegsgehälter deshalb einfriert, sollte einkalkulieren, dass die Konkurrenz um junge Fachkräfte davon nicht verschwindet. Und wer diese Umfragen als Prognose liest statt als Stimmungsbild, verwechselt eine Erwartung mit einem Befund.

Reportage

Eine Milliarde, die sich niemand ausgesucht hat: Warum im KI-Markt gerade die Verteilung über den Sieger entscheidet

Weiterlesen →

Tool-Radar

Neue und trendende KI-Tools des Tages

Dograh Logo
Quelloffene, selbst hostbare Plattform für Sprach-KI-Agenten — Terminbuchung, ein- und ausgehende Anrufe, visueller Ablauf-Editor mit über 30 Anbindungen.
Positioniert sich ausdrücklich als offene Alternative zu Vapi und Retell: keine Minutenpreise, keine hinter Bezahlschranken liegenden Funktionen, wahlweise selbst betrieben oder als verwalteter Dienst. Enthält Telefonie, Übergabe an Menschen, Aufzeichnung und automatische Qualitätsprüfung. Von Pritesh und Abhishek Kumar. Das Produkt ist älter — der Start auf Product Hunt erfolgte erst am 12. August und führte dort mit 467 Stimmen den Tag an.
Agenten · August 2026
Cohesor Logo
Neutrale Steuerungsebene zwischen KI-Agenten und Modellanbietern: komprimiert Anfragen, leitet sie an die passende Modellgröße weiter und deckelt Ausgaben je Nutzer oder Team.
Ein einziger Endpunkt, der die Protokolle von Anthropic und OpenAI nativ spricht — Claude Code und Codex lassen sich mit einer geänderten Zeile anbinden, ohne Codeumbau. Der Anbieter nennt rund 50 Prozent eingesparte Token und 60 bis 90 Prozent niedrigere Agentenrechnungen; das sind Herstellerangaben, die wir nicht geprüft haben. Von Funmi Lesi, Start auf Product Hunt am 12. August.
Infrastruktur · August 2026
Unsloth Desktop Logo
Quelloffene Desktop-Anwendung für macOS, Windows und Linux, um Modelle lokal auszuführen und nachzutrainieren — Sprachmodelle ebenso wie Bild-, Video- und Audiomodelle.
Das bekannte Unsloth-Projekt gab es bisher als Kommandozeile und im Browser; neu ist die lokale Oberfläche mit Modellsuche, Werkzeuganbindung und Feintuning ohne Code. Damit rückt Fine-Tuning in Reichweite von Teams ohne MLOps-Personal. Gegründet 2023 von den Brüdern Daniel und Michael Han, durchlief Y Combinator; kostenlos und quelloffen. Start auf Product Hunt am 12. August, Tagesrang 5 mit 203 Stimmen.
Dev-Tools · August 2026
CodeBurn Logo
Kostenloser, quelloffener Kostenzähler für KI-Programmierung: liest die Sitzungsdateien von über 40 Werkzeugen und schlüsselt Token- und Dollarverbrauch nach Aufgabe, Modell, Projekt und Pull Request auf.
Unterstützt unter anderem Claude Code, Cursor, Codex und Copilot und läuft vollständig lokal — kein Konto, MIT-Lizenz. Ein eigener Bereich weist Verschwendung aus, etwa aufgeblähte Caches und Wiederholungsaufrufe, und misst die tatsächlich erzielte Einsparung. Passt zur Beobachtung aus dem dritten Artikel dieser Ausgabe, dass die Folgekosten von KI-Code zum eigenen Markt werden. Von Resham Joshi und Aditya Vikram Singh; die genannten 150.000 Entwickler sind eine Herstellerangabe. Product Hunt am 12. August, Rang 12.
Dev-Tools · August 2026
LetterTrace Logo
Misst, wie oft Claude, ChatGPT und Gemini das eigene Unternehmen erwähnen — Sichtbarkeit, Stimmenanteil und Tonalität in KI-Antworten.
Statt eines Abos arbeitet das Werkzeug mit dem eigenen API-Schlüssel; vergleichbare Dienste beginnen laut Anbieter bei 250 Dollar im Monat. Vollständig quelloffen unter MIT-Lizenz und dauerhaft kostenlos, ohne Bezahlstufe. Relevant für alle, die gerade merken, dass Empfehlungen zunehmend im Chatfenster entstehen statt in der Suchergebnisliste. Von Mathew Pregasen und Casey Millstein; Product Hunt am 12. August, Tagesrang 3 mit 354 Stimmen.
Daten & Evals · August 2026
Gotcha Logo
Vollständig auf dem Gerät laufender KI-Assistent für Android, der über 100 Systemfunktionen per natürlicher Sprache steuert.
Der Unterschied zu einem Chatfenster ist, dass die App tatsächlich handelt: Sie bedient das Gerät über die Bedienungshilfen, spricht Termux an und bindet Home Assistant sowie Notion ein. Zwei Betriebsarten trennen Beobachten von Ausführen — eine sinnvolle Vertrauensstufe, wenn ein Agent echte Systemrechte hat. Quelloffen und kostenlos, von Rishabh Bajpai, Shivendra Pratap Singh und Durganshu Mishra. Start auf Product Hunt am 11. August.
Produktivität · August 2026

Aus der Werkstatt

YouTube-Empfehlungen: Tutorials, Erklärungen und Werkzeuge

Nemotron 3.5 Lightning vs Muse Glimmer on RTX 5090: Full Benchmark
Tutorial
KGP Talkie · 11:38
Direkter Vergleich der beiden offenen 30-Milliarden-Modelle, um die es im sechsten Artikel dieser Ausgabe geht — Nvidias Nemotron 3.5 Lightning gegen Metas Muse Glimmer, gemessen auf einer einzelnen RTX 5090. Getestet werden Kontextsuche bei 40.000 Token, Mathematik, Logik, JSON-Extraktion und eine Coding-Aufgabe. Der Kanal erklärt dabei, warum sich Geschwindigkeit und Speicherbedarf aus dem Architekturunterschied zwischen Mixture-of-Experts und dichtem Modell ergeben.
Design Challenge with Grok 4.6 in Cursor
Tutorial
Ray Fernando · 38:33
Praxistest von Grok 4.6 als Coding-Agent in Cursor, anhand einer vollständigen Neugestaltung einer iOS-App. Interessant ist weniger das Ergebnis als der Arbeitsablauf: eine Design-Vorgabe als Markdown-Datei, ein Cloud-Agent, der über Nacht durchläuft, und ein direkter Vorher-Nachher-Vergleich. Ordnet das Modell am Ende preislich gegen die konkurrierenden Coding-Modelle ein.