· 14 Artikel + Reportage + Tool-Radar + Werkstatt

Ausgabe vom 22. August 2026

Maschinell recherchiert, menschlich relevant.

Benchmarks · Agenten

Von 30 auf 100 Prozent, ohne das Modell anzufassen: Warum Nvidias Bestwert vor allem zeigt, wie wenig eine Benchmark-Zahl ohne ihre Fußnoten wert ist

Hintergrund & Analyse

Am 21. August hat Nvidia im hauseigenen Technical Blog gemeldet, das Agentensystem AVO — ausgeschrieben Agentic Variation Operators — habe auf dem Benchmark ARC-AGI-3 einen RHAE-Wert von 100,00 erreicht und dabei alle 183 Level in 25 Umgebungen gelöst. Zum Vergleich stellt Nvidia rund 30 Prozent für Claude Opus 5. Der Clou: AVO ist Claude Opus 5. Verändert wurde nicht das Modell, sondern alles darum herum.

Was ARC-AGI-3 misst, und warum es als schwer gilt. Der Benchmark stammt von der ARC Prize Foundation um François Chollet und ist der erste interaktive der Reihe. Statt statische Puzzles vorzulegen, setzt er einen Agenten in spielartige 2D-Umgebungen — ohne Anleitung, ohne erklärte Regeln, ohne genanntes Ziel. Der Agent muss die Mechanik durch Ausprobieren selbst erschließen, sich ein Modell der Welt bauen und über lange Handlungsketten mit spärlicher Rückmeldung planen. Für nichttechnische Leser ist das der entscheidende Unterschied zu einem Wissenstest: Hier wird geprüft, ob ein System sich in einer völlig neuen, unbeschrifteten Lage allein zurechtfindet. Genau das ist die Fähigkeit, die man von einem Agenten im Betrieb erwartet — und genau die, die reines Mustererkennen aus Trainingsdaten nicht liefert.

Was AVO tatsächlich tut. Die Architektur ist unspektakulär und gerade deshalb interessant: eine Schleife aus Inspizieren, Planen, Implementieren und Auswerten; ein Gedächtnis, das frühere Versuche, deren Ergebnisse und die Ausgaben des Übersetzers über die Runden hinweg mitführt; Werkzeuge, mit denen der Agent Code ausführen und Ergebnisse selbst nachprüfen kann. Der Baustein, den Nvidia selbst hervorhebt, ist ein zweiter Agent: ein Supervisor, der erkennt, wenn der Hauptagent sich im Kreis dreht, und ihn umlenkt. Adel El Hallak, VP Product in Nvidias KI-Sparte, gegenüber TechCrunch: „The more interesting part was introducing a supervising agent in addition to your main agent that's doing the work.“ Und grundsätzlicher: „Generally speaking, the world interprets an agent almost as an API of the model. But an agent is actually more than that. It is the model. It is the scaffolding around the model, which we call the harness, i.e. the set of tools that it utilizes.“

Und jetzt die Fußnoten — die erste liefert Nvidia selbst. Im Blogpost steht wörtlich: „These results cover the 25-environment ARC-AGI-3 public set using the official scorecard and RHAE metric. They are not results on the semi-private or fully private competition sets.“ Das ist eine bemerkenswert ehrliche Einschränkung, und sie ist zentral. ARC Prize führt seine offizielle Rangliste auf dem Semi-Private-Satz, gerade weil öffentlich zugängliche Aufgaben mit der Zeit in Trainingsdaten und Lösungswege einsickern. Nvidias Ergebnis ist also nicht auf dem Satz erzielt, der zählt.

Die zweite Fußnote betrifft den Vergleichswert. Die rund 30 Prozent, gegen die Nvidia seine 100 stellt, stammen nicht aus Nvidias eigenem Testlauf, sondern von ARC Prize — dort steht Claude Opus 5 mit hohem Reasoning-Aufwand bei 30,16 Prozent, geprüft am Semi-Private-Satz, zu Kosten von 20.657 Dollar für den Durchlauf. Verglichen werden damit zwei Zahlen aus zwei verschiedenen Datensätzen unterschiedlicher Härte. Der eigentlich naheliegende Vergleich — dasselbe Modell mit und ohne Harness auf demselben Satz — fehlt in der Quelle. Wie groß der Sprung wirklich ist, lässt sich aus den veröffentlichten Angaben deshalb nicht sauber ablesen.

Die dritte Fußnote ist die unbequemste: AVO war nicht die Erste. Das akademische Projekt VISTA hat auf denselben 25 öffentlichen Umgebungen mit demselben Basismodell bereits vorher einen RHAE-Wert von 100 erreicht — Nvidia führt VISTA im eigenen Blogpost als Vergleichsgrundlage an und schreibt, man habe „adopted the direct-interaction design principles described by VISTA and reimplemented the task interface independently“. Ein weiteres Projekt, Schema-Harness, berichtet nach eigenen Angaben rund 99 Prozent. Der Effizienzvorsprung, den Nvidia für sich reklamiert, beträgt gegenüber VISTA etwa 12 Prozent weniger Aktionen (6.624 gegen 7.542) — Nvidia räumt allerdings selbst ein, dass sich beide Systeme in Modell-Backend, Beobachtungsdarstellung, Gedächtnis und Kontextführung unterscheiden und der Vergleich deshalb nicht sauber ist. Kosten- oder Laufzeitangaben pro Aufgabe nennt der Blogpost nicht.

Fairerweise muss man sagen: Nvidia schreibt die wichtigste Einschränkung selbst hin. Im Blogpost heißt es, der Vergleich zum nackten Modell „should not be interpreted as a controlled ablation“ — also ausdrücklich nicht als saubere Isolierung der einen veränderten Variable. Und weiter, in einem Satz, der die ganze Meldung besser zusammenfasst als ihre Überschrift: „benchmark performance reflects the complete agent system, not only the underlying model.“ Das ist keine Marketingaussage, sondern eine methodisch korrekte. Die 100 Prozent gehören nicht Claude Opus 5 und auch nicht Nvidia, sondern der Kombination aus beidem — und genau das ist die eigentliche Nachricht.

Was das für die Einordnung heißt. AVO taucht in der offiziellen ARC-Prize-Rangliste nicht auf. Das ist kein Vorwurf, sondern eine Folge der Regeln: Nach der veröffentlichten Verifizierungsrichtlinie führt ARC Prize die als verified gekennzeichneten Werte selbst durch, über standardisierte öffentliche Modellschnittstellen; eingereichte eigene Harness-Läufe werden standardmäßig nicht verifiziert. Für eine Verifizierung wären ein Code-Audit, eine in unter zwölf Stunden reproduzierbare Ausführung als Kaggle-Notebook, die vollständige Offenlegung der Lösung als Open Source und eine Kostenobergrenze von 10.000 Dollar pro Lauf nötig. Nichts davon ist für AVO öffentlich nachvollziehbar. Eine Stellungnahme der ARC Prize Foundation zu Nvidias Meldung war bis Redaktionsschluss nicht auffindbar.

Warum die These trotzdem trägt. Es wäre falsch, die Meldung wegen ihrer Fußnoten abzutun — der Kern stimmt, und er wird von unabhängigen Datenpunkten gestützt. TechCrunch berichtet, auch OpenAI habe seine ARC-AGI-3-Werte verdreifacht, indem lediglich zwei Einstellungen am Harness verändert wurden. Databricks-Chef Ali Ghodsi beschreibt dieselbe Hebelwirkung auf der Kostenseite: „You can pick the same model but different harnesses, and you get significantly more cost if you use the wrong harness … That itself can 2x your cost.“ Und der vielleicht stärkste Beleg ist gerade die dritte Fußnote: Dass voneinander unabhängige Gruppen — ein akademisches Projekt und ein Konzernlabor — mit demselben Basismodell von etwa 30 auf nahezu 100 Prozent kommen, zeigt robuster als jede Einzelmeldung, wie groß der Hebel von Gedächtnisführung, Rückkopplungsschleifen und Werkzeugorchestrierung ist.

Was Sie praktisch daraus mitnehmen sollten. Erstens: Wenn ein Anbieter eine Benchmark-Zahl nennt, ist die erste Frage nicht „wie hoch“, sondern „auf welchem Satz, von wem geprüft, mit welchem Gerüst darum herum“. Zweitens: Der größte verfügbare Hebel für die Qualität eines Agenten liegt derzeit nicht im nächsten Modellwechsel, sondern in der Schicht darum herum — und diese Schicht können Sie selbst kontrollieren. Drittens, und das ist die Kehrseite: Dieselbe Schicht bestimmt Ihre Rechnung. El Hallak wirbt erkennbar für offene Systeme — „We believe, and we're demonstrating with the ecosystem, how open harnesses allow you to turn a lot more knobs to drive up that accuracy.“ — und man darf mitdenken, dass Nvidia ein Interesse daran hat, dass möglichst viele Knöpfe möglichst viel Rechenzeit verbrauchen. Warum die Harness-Schicht 2026 zur eigentlichen Produktentscheidung geworden ist, führen wir in der Reportage dieser Ausgabe aus.

Börsengang · Anthropic

Vom vertraulichen Entwurf zum öffentlichen Antrag: Anthropic will noch im August liefern — und holt sich eine vierte Bank dazu

Hintergrund & Analyse

heise online hat am 21. August unter Berufung auf Bloomberg berichtet, Anthropic wolle noch bis Ende dieses Monats den öffentlichen Antrag für seinen Börsengang einreichen. Wörtlich bei heise-Autor Axel Kannenberg: „Anthropic will noch zum Ende dieses Monats den öffentlichen Antrag für seinen mit Spannung erwarteten Börsengang einreichen, wie die Finanznachrichtenagentur Bloomberg unter Berufung auf anonyme Insider berichtet.“

Warum ein Verfahrensschritt eine Nachricht ist. Seit Anfang Juni liegt der Prospekt vertraulich bei der US-Börsenaufsicht SEC — ein Verfahren, das Unternehmen erlaubt, den Text mit der Behörde abzustimmen, ohne Finanzdaten offenzulegen. Der öffentliche Antrag ist der Moment, in dem die Zahlen tatsächlich auf den Tisch kommen: geprüfte Abschlüsse, Risikofaktoren, Beteiligungsverhältnisse. Für alle, die bisher über Anthropics Wirtschaftlichkeit spekulieren mussten, ist das der erste belastbare Datenpunkt seit Gründung. Wir haben über die Vorstufen am 16. August und über die Umsatzzahlen am 18. August berichtet.

Neu gegenüber unserer bisherigen Berichterstattung sind genau zwei Dinge. Erstens die Verschärfung des Zeitplans — bislang war lediglich bekannt, dass ein vertraulicher Entwurf existiert. Zweitens eine personelle Erweiterung des Bankenkonsortiums: Nach einem Bloomberg-Bericht vom 20. August soll Citigroup als viertes führendes Institut neben Morgan Stanley, Goldman Sachs und JPMorgan hinzukommen. Auch das ist anonym gesourct: „Anthropic PBC is set to add Citigroup Inc. to the banks working on its initial public offering, according to people familiar with the matter“, und weiter: „Deliberations are ongoing, details could change and more banks are expected to be added to the lineup, the people said, asking not to be identified as the information isn't public.“ Anthropic und Citigroup haben eine Stellungnahme abgelehnt. Dass Citigroup dazustößt, ist plausibel — die Bank unterhält bereits eine Kreditlinie über 2,5 Milliarden Dollar mit Anthropic.

Die Zahlen, die dabei durch die Presse laufen, verdienen eine Warnung. Genannt werden: ein Verlust von rund 42 Milliarden Dollar für 2025, etwa das Fünffache der 8,3 Milliarden aus 2024; über 11,5 Milliarden Dollar Umsatz im zweiten Quartal 2026 bei erstmals positivem bereinigtem Betriebsergebnis; eine annualisierte Umsatzrate von über 65 Milliarden Dollar zum Ende Juli. Jede dieser Angaben stammt aus Bloomberg-Berichten, die sich auf Dokumente oder anonyme Personen stützen. Keine einzige davon ist von Anthropic offiziell bestätigt oder testiert. Beim bereinigten Ergebnis ist zudem nicht offengelegt, welche Posten herausgerechnet wurden — und eine annualisierte Rate ist eine Hochrechnung aus einem Monat, keine Jahreszahl. Die Verlustangabe für 2025 ist überdies kein Ereignis dieser Woche: Sie stammt aus derselben Bloomberg-Meldung von Mitte August, aus der auch die Umsatzrate kam.

Auch die vielzitierten Bewertungsprognosen sollte man mit Abstand lesen. heise merkt zu der von Reuters berichteten Umsatzprognose von 190 bis 200 Milliarden Dollar für 2028 selbst an: „Die Annahmen hinter der optimistischen Prognose seien allerdings intransparent.“ Bekannt und bestätigt ist demgegenüber nur die Finanzierungsrunde vom Mai: 65 Milliarden Dollar frisches Kapital bei einer Bewertung von 965 Milliarden Dollar. Als Zielgröße für die Emission wird die Größenordnung des SpaceX-Börsengangs genannt, der rund 75 Milliarden Dollar Basiserlös und mit Mehrzuteilung etwa 86 Milliarden einbrachte.

Was daraus folgt. Für Kunden ändert ein Börsengang zunächst wenig, für die Erwartungshaltung an das Unternehmen dagegen viel: Ein börsennotiertes Anthropic muss vierteljährlich liefern und seine Ausgaben öffentlich rechtfertigen — bei einem Unternehmen, dessen Selbstbeschreibung auf Sicherheitsforschung und bewusster Zurückhaltung beruht, ist das ein Spannungsverhältnis, das bislang nur intern ausgetragen wurde. Praktisch heißt das für Sie vor allem: Wenn Ende August das öffentliche Dokument erscheint, ersetzt es sämtliche der oben genannten Presse-Rekonstruktionen. Bis dahin sind auch die eindrucksvollsten Zahlen genau das — Rekonstruktionen.

Finanzstabilität · Euroraum

440 Milliarden Euro in sieben US-Aktien: Fünf EZB-Ökonomen halten eine Korrektur für wahrscheinlich — und sagen ausdrücklich, dass sie nicht für die EZB sprechen

Hintergrund & Analyse

Zur Datumslage: Der Beitrag erschien am 17. August im Blog der EZB, die deutschsprachige Berichterstattung durch heise online folgte am 21. August. Wir datieren den Artikel auf das Ereignis, nicht auf die Nachberichterstattung.

Unter dem Titel „The AI boom: rational enthusiasm or the next dot-com bubble?“ haben fünf Ökonominnen und Ökonomen der Europäischen Zentralbank — Malin Andersson, Johannes Breckenfelder, Stefano Corradin, Kalin Nikolov und Maria Antonietta Viola — eine Analyse veröffentlicht, deren zentraler Satz knapp ausfällt: „A correction of current stock market valuations is likely.“

Eine Klarstellung vorweg, die in mehreren Berichten untergegangen ist. Dies ist keine Warnung der EZB. Der Text steht im Format „The ECB Blog“, das Forscherinnen und Forschern des Hauses erlaubt, unter eigenem Namen zu publizieren, und trägt den ausdrücklichen Hinweis: „The views expressed in each blog entry are those of the author(s) and do not necessarily represent the views of the European Central Bank and the Eurosystem.“ Es handelt sich also weder um den Finanzstabilitätsbericht noch um eine geldpolitische Positionierung. Wer daraus „Die EZB warnt“ macht, gibt den Vorgang falsch wieder. Gewicht hat der Beitrag trotzdem, weil er auf internen Bestandsdaten der Notenbank beruht, die außerhalb des Hauses niemand hat.

Die Zahl, um die es geht. Europäische Haushalte halten nach den Berechnungen der Autoren rund 440 Milliarden Euro an US-Technologieaktien — überwiegend nicht als Direktbesitz, sondern über Investmentfonds und börsengehandelte Indexfonds. Im Original: „Euro area households, which are increasingly channelling funds into low-cost ETFs, have around €440 billion of exposures to US technology equities without necessarily being aware of the associated concentration risk.“ Der Nachsatz ist der eigentliche Punkt: ohne sich des Konzentrationsrisikos zwangsläufig bewusst zu sein. Wer einen breiten Welt- oder US-Index bespart, hält heute einen erheblichen Anteil in sieben Einzelwerten — den „Magnificent Seven“ Nvidia, Apple, Alphabet, Microsoft, Amazon, Meta und Tesla. Einordnung zur Zahl: Sie bezieht sich laut Fußnote der zugehörigen Grafik auf Marktwerte zum dritten Quartal 2025, ist also kein tagesaktueller Stand. Dass auch Versicherer und Pensionsfonds erhebliche Bestände halten, schreiben die Autoren ausdrücklich — eine Zahl dafür nennen sie nicht; die in der deutschen Berichterstattung kursierende Größenordnung „weitere hunderte Milliarden“ stammt von heise, nicht aus dem Blogbeitrag.

Der Mechanismus, der aus einem Kursrutsch ein Stabilitätsproblem macht. Er liegt nicht in den Kursverlusten selbst, sondern in der Fondsstruktur. Fällt der Markt, ziehen Anleger Geld aus den Fonds ab; um die Rücknahmen zu bedienen, müssen die Fonds verkaufen — zuerst das, was sich leicht verkaufen lässt, danach das, was nur noch mit Abschlag loszuwerden ist. Dieser Zwangsverkauf drückt die Kurse weiter und löst die nächste Runde aus. Die Autoren nennen als zweiten Kanal die Frage, wie stark die Übertreibung an den europäischen Börsen selbst ausgeprägt ist — und geben hier teilweise Entwarnung: Die Bewertungsniveaus im Euroraum liegen deutlich unter den amerikanischen, die Indizes sind stärker von klassischer Industrie geprägt. Nur nützt das wenig, weil die Märkte historisch hoch korreliert sind. Ihr Fazit dazu: „A US AI fallout would not remain a US problem.“

Der Punkt, der die Analyse von den üblichen Blasenwarnungen unterscheidet, ist die Behandlung der Gegenposition. Die Autoren stellen zwei Erklärungen nebeneinander: die rationale, nach der hohe Bewertungen bei echter technologischer Unsicherheit gerechtfertigt sein können, und die verhaltensökonomische, nach der selbstsichere Anleger die Kurse über den Fundamentalwert treiben. Ihre Schlussfolgerung gilt in beiden Fällen — auch wenn die Bewertungen heute rational sind, wird eine Korrektur wahrscheinlich, sobald sich die Unsicherheit auflöst. Historische Parallelen ziehen sie zum Eisenbahnboom des 19. Jahrhunderts und zur Elektrifizierung der 1920er, nicht nur zur Dotcom-Blase.

Unbequem ist der letzte Befund: Der geldpolitische Spielraum ist heute enger als 2000. Wörtlich: „Unlike in the dot-com episode, today's starting point leaves markedly less room to cut interest rates or use fiscal policy to cushion the fallout.“ Nach dem Platzen der Dotcom-Blase konnten Notenbanken die Zinsen deutlich senken; von den heutigen Niveaus aus ist dieser Puffer kleiner.

Was das praktisch bedeutet. Für Unternehmen jenseits der Finanzbranche ist die Botschaft weniger eine Anlageempfehlung als eine Planungsfrage: Wenn ein erheblicher Teil der Bewertung im KI-Sektor auf Erwartungen beruht, dann hängen daran auch Investitionsbudgets, Rechenzentrumsausbau und die Preise, zu denen Sie heute Inferenz einkaufen. Wir haben die Finanzierungsmechanik dahinter in unseren Reportagen vom 13. Juli und 22. Juli ausgeführt. Die praktische Konsequenz ist unspektakulär und deshalb leicht zu übersehen: Verträge, die auf dauerhaft subventionierte Token-Preise setzen, sollten eine Annahme darüber enthalten, was passiert, wenn die Subvention endet.

Sicherheit · Modellrichtlinien

Die Regel gilt, die Durchsetzung nicht: TechCrunch bringt ein älteres Claude-Modell in zehn von zehn Versuchen dazu, seine eigenen Inhaltsgrenzen zu ignorieren

Hintergrund & Analyse

Einzelquellen-Hinweis vorweg: Dieser Befund beruht ausschließlich auf einem Test von TechCrunch vom 21. August. Eine unabhängige Bestätigung durch ein anderes Medium war bis Redaktionsschluss nicht auffindbar. Wir kennzeichnen das ausdrücklich und behandeln die Zahlen entsprechend zurückhaltend.

TechCrunch hat Claude Opus 4.6 systematisch auf die Einhaltung von Anthropics Inhaltsregeln geprüft. Das Ergebnis: Bei zehn von zehn direkten Anfragen nach explizit sexuellen Inhalten lieferte das Modell ohne nennenswerten Widerstand. Zusätzlich stellte ein anonymer britischer Sicherheitsforscher eine mehrstufige Umgehungstechnik zur Verfügung — eskalierendes Rollenspiel —, die TechCrunch in fünf weiteren Durchläufen reproduzieren konnte.

Die entscheidende Differenzierung steht im Kleingedruckten. Betroffen sind Opus 4.6, Opus 3 und Haiku 4.5 — also ältere Modellgenerationen. Die neueren Modelle von Opus 4.7 bis zum aktuellen Opus 5 erwiesen sich gegen dieselbe Technik als widerstandsfähig. Das ist der Grund, warum wir diese Meldung nicht als Kurswechsel lesen: Hätte Anthropic seine Inhaltspolitik bewusst gelockert, müssten die neueren Modelle freizügiger sein, nicht strenger. Was hier sichtbar wird, ist das Gegenteil — eine Durchsetzungslücke in älteren Generationen, die im Betrieb bleiben, während die Absicherung nur in den jeweils neuen Modellen nachgezogen wird.

Anthropics Reaktion ist reaktiv, nicht proaktiv. Es gibt keinen Blogpost, keine geänderte Modellkarte, keine Aktualisierung der Nutzungsrichtlinie zu diesem Fund — nur eine Sprecherstellungnahme gegenüber TechCrunch. Darin verweist das Unternehmen auf die unveränderte Regel: „Anthropic's universal usage standards for Claude forbid the model from generating sexually explicit content.“ Zur praktischen Relevanz heißt es, entsprechende Anwendungsfälle seien „rare, making up less than 0.1% of all conversations“, und man verbessere die Schutzmaßnahmen „with each new model release“. Aus der Lücke bei Erwachseneninhalten lasse sich zudem nicht auf eine breitere Umgehbarkeit „in higher-risk areas“ schließen.

Warum das für Unternehmenskunden relevant ist, obwohl das Thema harmlos klingt. Die inhaltliche Frage ist hier zweitrangig; die strukturelle ist es nicht. Wer ein älteres Modell aus Kosten- oder Stabilitätsgründen weiterbetreibt — und dafür gibt es gute Gründe, etwa festgeschriebene Ausgabeformate oder abgenommene Testfälle —, betreibt damit möglicherweise auch einen älteren Stand der Absicherung. Die Nutzungsrichtlinie des Anbieters gilt formal für alle Modelle gleich; ihre technische Durchsetzung tut das erkennbar nicht. Nach TechCrunchs Angaben wird Opus 4.6 weiterhin intensiv genutzt: rund 1,17 Millionen tägliche Programmierschnittstellen-Anfragen und 46 Milliarden Token im August.

Die praktische Konsequenz für Betreiber ist deshalb nicht, das Modell zu wechseln, sondern die Prüfung dort anzusiedeln, wo sie unabhängig vom Modellstand greift: in der eigenen Anwendungsschicht. Das ist derselbe Gedanke, der auch dem Leitartikel dieser Ausgabe zugrunde liegt — die Schicht um das Modell herum entscheidet, und zwar nicht nur über die Qualität, sondern auch über das, was durchkommt.

Zum zeitlichen Zusammenhang, ohne Kausalität zu behaupten: Der Befund fällt in die Woche, in der Anthropic den öffentlichen Antrag für seinen Börsengang vorbereitet — dem zweiten Artikel dieser Ausgabe. Ein Unternehmen, das sich als sicherheitsorientiertes Labor an die Börse begibt, wird sich an der Frage messen lassen müssen, wie lange Absicherungen für Modelle im aktiven Betrieb nachgeführt werden. Einen belegbaren Zusammenhang zwischen beiden Vorgängen gibt es nicht, und wir behaupten keinen.

Infrastruktur · Orbit

250 Millionen Dollar, um Raketenplätze zu kaufen: Starcloud sammelt nicht für Technik, sondern für Startkapazität

Hintergrund & Analyse

Starcloud hat seine im März gemeldete Series-A-Runde um 250 Millionen Dollar erweitert. Das Unternehmen kommt damit auf insgesamt 420 Millionen Dollar und wird mit 2,3 Milliarden Dollar bewertet — gegenüber 1,1 Milliarden im Frühjahr mehr als eine Verdopplung. Angeführt wird die Erweiterung von Manhattan West Ventures; beteiligt sind unter anderem Nvidia mit 25 Millionen Dollar, Cisco, Benchmark, EQT, Soma, NFX, 776, Cedar Capital, Goanna Capital und Standard Capital. Über die ursprüngliche Runde und das Grundproblem orbitaler Rechenzentren haben wir in unserer Reportage vom 15. Juni ausführlich berichtet.

Der eigentliche Nachrichtenwert liegt im Verwendungszweck. Starcloud sammelt das Geld nicht in erster Linie für neue Technik, sondern um sich Startkapazität für die kommenden Jahre vorab zu sichern. Gründer Philip Johnston benennt den Grund unumwunden: „launch is pretty constrained right now because [SpaceX's] Falcon 9 program is scheduled to end in 2028.“ Und weiter: „One of the biggest costs is now on securing your launch capacity.“ Sowie, mit bemerkenswerter Offenheit über das eigene Klumpenrisiko: „Obviously if we can't book any SpaceX launch capacity in 2029, that will be challenging for us.“ Zusammengefasst hat er es so: „We can see what's coming — we're going to need to book an enormous amount of launch.“

Warum das ein struktureller Befund ist und keine Firmenmeldung. Die gesamte Geschäftsidee orbitaler Rechenzentren beruht darauf, dass Masse günstig in den Orbit kommt. Falcon 9 hat diese Annahme jahrelang getragen. Läuft das Programm wie geplant 2028 aus, hängt alles an Starship — das für den regulären kommerziellen Einsatz noch nicht erprobt ist — oder an Alternativen wie New Glenn von Blue Origin, Vulcan von ULA und Neutron von Rocket Lab, die sämtlich noch nicht im verlässlichen Regelbetrieb fliegen. Ein Unternehmen, das eine Viertelmilliarde Dollar aufnimmt, um Frachtplätze zu reservieren, sagt damit implizit: Der Engpass ist nicht mehr die Technik, sondern der Zugang zur Umlaufbahn.

Der technische Stand, nüchtern betrachtet. Starcloud betreibt mit Starcloud-1 nach eigenen Angaben eine Nvidia-H100-Grafikeinheit im Orbit und hat daraus Daten für Nvidias Chipentwicklung geliefert. Als Nächstes ist für 2027 Starcloud-2 vorgesehen: zwei Satelliten mit je acht Kilowatt Rechenleistung, gestartet als Mitfluglast. Starcloud-3 ist als größtes Fahrzeug für den Start mit Starship ausgelegt. Das Unternehmen beschäftigt 25 Mitarbeitende, bezieht eine Fertigungsfläche von rund 9.300 Quadratmetern in Woodinville im US-Bundesstaat Washington und hat bei der Regulierungsbehörde FCC einen Antrag für den Betrieb von 88.000 Raumfahrzeugen gestellt.

Was in der Berichterstattung fehlt und deshalb hier steht: Zu den beiden Fragen, an denen das Konzept technisch hängt — Wärmeabfuhr im Vakuum und Strahlungsfestigkeit im Dauerbetrieb —, liefert die Meldung keine Zahlen. Es gibt auch keine Angaben zur bisherigen Betriebsdauer oder zur Ausfallrate von Starcloud-1 und keine unabhängige technische Einschätzung. Die Relation ist damit bemerkenswert: 88.000 beantragte Raumfahrzeuge stehen einer einzelnen nachgewiesenen Grafikeinheit im Orbit gegenüber. Das ist kein Einwand gegen das Vorhaben, aber der Maßstab, an dem man die nächsten Meldungen messen sollte.

Kartellrecht · Wagniskapital

Ein Gesetz von 1914 gegen den größten KI-Investor: Das US-Justizministerium prüft, ob a16z in konkurrierenden Aufsichtsräten sitzt

Hintergrund & Analyse

Zur Datumslage: Der Vorgang wurde am 17. August durch eine Bloomberg-Exklusivrecherche bekannt und am 18. August von TechCrunch und Axios aufgegriffen. Anlass für die Aufnahme in diese Ausgabe ist die ausführliche TechCrunch-Aufarbeitung vom 21. August. Wir datieren auf das Ereignis, nicht auf die Nachberichterstattung.

Das US-Justizministerium untersucht Andreessen Horowitz — kurz a16z, einen der einflussreichsten Kapitalgeber der KI-Branche — wegen möglicher Verstöße gegen Section 8 des Clayton Act. Die Vorschrift stammt aus dem Jahr 1914 und verbietet es, gleichzeitig in den Aufsichtsgremien konkurrierender Unternehmen zu sitzen. Der Gedanke dahinter ist einfach: Wer in beiden Chefetagen sitzt, kann Wettbewerb koordinieren, statt ihn auszutragen.

Die konkreten Mandate. Mitgründer Ben Horowitz sitzt im Aufsichtsgremium von Databricks, das zuletzt mit 190 Milliarden Dollar bewertet wurde. Partner Martin Casado sitzt in dem von Fivetran, das am 1. Juni 2026 mit dbt Labs fusionierte. Beide Unternehmen gelten inzwischen als Wettbewerber im Geschäft mit Datenpipelines und Dateninfrastruktur. Der entscheidende Punkt ist die Zeitachse: Als a16z ursprünglich investierte, waren die Firmen nicht notwendigerweise direkte Konkurrenten. Sie sind es durch die Marktentwicklung und durch Zukäufe geworden.

Zum Verfahrensstand ist Zurückhaltung geboten. Es gibt keine offizielle Bestätigung des Justizministeriums. Die Information stammt aus einer Bloomberg-Recherche; Ministerium, Databricks und a16z haben eine Stellungnahme abgelehnt oder nicht reagiert. Die Untersuchung läuft nach diesen Angaben bereits seit etwa einem Jahr, zeitlich parallel zur kartellrechtlichen Prüfung der Fusion von Fivetran und dbt Labs, die das Ministerium ohne Auflagen freigab. Eine Entscheidung ist nicht gefallen; das Verfahren kann auch folgenlos enden.

Warum die Branche nervös reagiert. TechCrunch hält fest: „Several VCs told TechCrunch they were surprised by news of the probe.“ Die Überraschung hat einen Grund — Section 8 wurde gegenüber Wagniskapitalgebern bislang praktisch nicht durchgesetzt. Die möglichen Folgen beschreibt TechCrunch so: „If a16z is forced to surrender a seat, founders may place less value on board commitments from top-tier VCs, given that those investors might be forced to step down if a portfolio overlap creates a future conflict.“ Übersetzt heißt das: Der Aufsichtsratssitz ist im Wagniskapital nicht bloß Kontrolle, sondern ein Verkaufsargument gegenüber Gründern — die Zusage, dass ein erfahrener Investor dauerhaft mit am Tisch sitzt. Wird dieses Versprechen widerruflich, verliert es an Wert.

Der KI-Bezug ist struktureller Natur. In keinem Bereich überlappen Portfolios so schnell und so unabsichtlich wie in der KI-Infrastruktur. Ein Kapitalgeber, der heute in ein Modellhaus, eine Datenplattform und ein Agenten-Framework investiert, hält morgen womöglich Anteile an drei Unternehmen, die um dieselben Kunden konkurrieren — weil sich die Produkte aufeinander zubewegt haben, nicht weil jemand eine Absicht hatte. Genau diese Dynamik trifft die Vorschrift. Sollte das Ministerium durchgreifen, müssten Kapitalgeber ihre Mandate laufend daraufhin prüfen, ob aus Nachbarn Konkurrenten geworden sind. Das wäre keine Randnotiz, sondern eine Änderung der Arbeitsweise einer ganzen Branche.

Infrastruktur · Nvidia

Noch eine Stufe früher in der Kette: Nvidia beteiligt sich am Stromvermittler Cloverleaf

Hintergrund & Analyse

Nvidia geht eine Minderheitsbeteiligung an Cloverleaf Infrastructure ein, einem 2024 gegründeten Unternehmen, das seinerzeit 300 Millionen Dollar Startkapital von NGP und Sandbrook Capital eingesammelt hatte. Die Höhe der Investition wurde nicht offiziell offengelegt; das Wall Street Journal berichtet von einem Betrag im Bereich mehrerer hundert Millionen Dollar. Cloverleaf setzt künftig Nvidias DSX-Plattform ein, ein Referenzentwurf für die gemeinsame Planung von Standort, Stromversorgung, Kühlung und Rechenkapazität.

Was Cloverleaf tut, ist die eigentliche Pointe. Das Unternehmen betreibt keine Rechenzentren. Es vermittelt zwischen Energieversorgern und Betreibern und sichert Netzanschlusszusagen, bevor gebaut wird. Das klingt nach Verwaltungsarbeit, ist aber derzeit der härteste Engpass der Branche: Rechenkapazität lässt sich in Monaten beschaffen, ein Anschluss ans Stromnetz dauert in vielen US-Regionen Jahre. Wer die Anschlusszusage hat, bestimmt, wo gebaut werden kann.

Die Beteiligten formulieren es entsprechend. Nico Caprez, VP bei Nvidia: „AI factories are the infrastructure of the intelligence age, and land, power and shell are their foundation.“ Cloverleaf-Chef David Berry: „AI is accelerating demand for digital infrastructure at an unprecedented scale.“ TechCrunch ordnet den Vorgang knapp ein: „The deal is part of Nvidia's ongoing push to use its immense profits to keep the AI flywheel spinning.“

Das Muster ist bekannt, die Stufe ist neu. Nvidia investiert seit Monaten in die Abnehmerseite seiner eigenen Chips — wir haben das bei der gekappten OpenAI-Garantie und der Beteiligung an SB Energy am 18. August und beim Blick in Nvidias Depotmeldung am 16. August beschrieben. Neu an diesem Fall ist die Position in der Kette: Es geht nicht mehr um einen Betreiber oder einen Cloud-Anbieter, sondern um den vorgelagerten Standort- und Energieentwickler. Nvidia sichert damit nicht die Nachfrage nach Chips, sondern die Voraussetzung dafür, dass diese Nachfrage überhaupt entstehen kann.

Zur Belastbarkeit der Zahlen: Angaben zu Cloverleafs Projektumfang — kolportiert werden mehr als sieben Gigawatt bereits verkaufte Projekte und eine Gesamtpipeline von über zehn Gigawatt — stehen nicht in der TechCrunch-Meldung oder der Pressemitteilung, sondern stammen aus Fachdiensten wie DataCenterDynamics. Wir führen sie deshalb als nicht unabhängig bestätigt.

Studie · Nutzungsdaten

Fast die Hälfte fällt aus der Statistik: Ein Forschungsverbund zeigt, was die Nutzungsberichte der KI-Anbieter systematisch ausblenden

Hintergrund & Analyse

Zur Datumslage: Das Vorabpapier und die Berichterstattung der MIT Technology Review datieren auf den 18. August, die deutschsprachige Zusammenfassung durch t3n auf den 21. August. Wir datieren auf das Ereignis.

Unter dem Namen The AI Observatory hat ein breites Forschungskonsortium einen Datensatz und eine öffentliche Auswertungsplattform vorgelegt, die eine schlichte, aber selten gestellte Frage beantworten sollen: Wofür benutzen Menschen KI-Assistenten eigentlich wirklich? Beteiligt sind unter anderem MIT, Stanford, Northeastern, Johns Hopkins, UC Berkeley, Carnegie Mellon, NYU, Brown, die University of Waterloo, EleutherAI und Cohere. Erstautoren sind Shayne Longpre (MIT), Anka Reuel (Stanford) und Dayeon Ki (University of Maryland).

Warum es diese Arbeit überhaupt braucht. Was wir über die Nutzung von KI-Assistenten zu wissen glauben, stammt fast vollständig von den Anbietern selbst — etwa aus Anthropics Wirtschaftsindex oder vergleichbaren Auswertungen von OpenAI. Diese Berichte sind nicht falsch, aber sie sind von den Unternehmen erstellt, die ein Interesse am Ergebnis haben, und sie sind von außen nicht überprüfbar. Reuel formuliert das Problem gegenüber der MIT Technology Review in fünf Worten: „There is no independent source to corroborate it.“ Longpre ergänzt: „No single company report tells the whole story.“

Woraus der Datensatz besteht. Zusammengeführt wurden sieben bestehende Sammlungen aus den Jahren 2023 bis 2025: insgesamt 23.158 Konversationen mit 85.633 Gesprächsrunden und 171.266 Einzelnachrichten von rund 5.000 Nutzerinnen und Nutzern über mehr als 25 Modelle hinweg. Die größte Einzelquelle ist WildChat mit 14.648 Dialogen; hinzu kommen ShareGPT, ein privater Stichprobenbestand, ein Grok-Datensatz von X, LMSYS-Chat-1M, Chatbot Arena und das National Internet Observatory, das nur aggregierte Statistiken beisteuert. Wichtig für die Bewertung: Die Daten stammen aus freiwilliger Zustimmung oder aus bereits geteilten, öffentlichen Beständen — nicht aus heimlichem Abgreifen. Annotiert wurde entlang einer Systematik aus 145 Merkmalen auf vier Ebenen.

Der Kernbefund ist ein methodisches Experiment. Die Forschenden haben Anthropics eigene Filterlogik auf ihren unabhängigen Datensatz angewandt — also gefragt: Was passiert mit diesen 23.158 Gesprächen, wenn man sie durch dasselbe Sieb schüttet, durch das der offizielle Wirtschaftsindex entsteht? Antwort: 47,9 Prozent werden als „nicht beruflich“ herausgefiltert und tauchen in der veröffentlichten Statistik nie auf. Darunter fällt viel Persönliches, Soziales, Kulturelles — und ein erheblicher Teil dessen, was sicherheitsrelevant wäre. Der Filter ist nicht heimlich; er ist dokumentiert und für den Zweck eines Wirtschaftsindex sogar nachvollziehbar. Nur wird das Ergebnis anschließend als Aussage über KI-Nutzung insgesamt gelesen, und das trägt es nicht.

Zur Belastbarkeit einzelner Zahlen: Die in der Berichterstattung kursierenden Detailvergleiche — etwa 44,2 gegen 31,2 Prozent bei Gesundheits- und Beziehungsthemen oder 16,7 gegen 2,4 Prozent bei sexuellen Inhalten — stammen aus der Darstellung der MIT Technology Review. Wir führen sie ausdrücklich als deren Angabe und nicht als direktes Zitat aus dem Papier, das den Status Preprint trägt, also noch keine Begutachtung durchlaufen hat.

Was Sie praktisch mitnehmen sollten. Wenn in einer Vorstandsvorlage steht, „X Prozent der KI-Nutzung entfällt auf berufliche Anwendungen“, dann ist die Rückfrage nicht, ob die Zahl stimmt, sondern was vorher weggefiltert wurde. Das gilt in beide Richtungen: Wer aus Anbieterzahlen ableitet, dass KI überwiegend produktiv genutzt wird, überschätzt den Anteil; wer aus derselben Quelle Rückschlüsse auf Risiken zieht, unterschätzt sie. Für die eigene Organisation heißt das schlicht, dass man Nutzungsdaten selbst erheben muss, wenn man sie für Entscheidungen braucht — und dass diese Erhebung ihre eigenen Filter offenlegen sollte.

Regulierung · Autonomes Fahren

8.000 Genehmigungen in Clark County — und ein Lobbystreit darüber, ob der Mensch am Steuer bleiben muss

Hintergrund & Analyse

Die Nevada Transportation Authority hat einstimmig Kontingente für fahrerlose Taxis in Clark County freigegeben — dem Landkreis, zu dem Las Vegas und die umliegenden Gemeinden gehören. Die Aufteilung: Waymo 1.000 Fahrzeuge, Uber 1.000, Tesla bis zu 5.000. Zoox verfügte bereits zuvor über eine gesonderte Genehmigung für 100 Fahrzeuge. Zuständig ist nicht die Kfz-Zulassungsbehörde, sondern die Verkehrsaufsicht, die seit einer Gesetzesreform von 2015 den gewerblichen Personenverkehr in Nevada reguliert.

Die Zahl ist eine Obergrenze, keine Ankündigung. Tesla selbst erklärte, man wäre „extrem zufrieden“, wenn binnen eines Jahres 2.500 Fahrzeuge — also die Hälfte des eigenen Kontingents — auf der Straße wären. Uber sicherte zu, dass menschliche Fahrer parallel im Einsatz blieben. Lokale Taxi- und Limousinenunternehmen hatten Einwände vorgebracht: Sie fürchten eine Übersättigung des Marktes und zusätzliche Staus auf der Strecke zwischen Flughafen und Innenstadt. Die Genehmigung ist von der kalifornischen Entscheidung zu trennen, über die wir am 16. August berichtet haben — anderer Bundesstaat, andere Behörde, eigenes Verfahren.

Am selben Tag wurde sichtbar, womit dieser Rahmen erkämpft wird. Die Financial Times hat, syndiziert über Ars Technica, die Lobbyoffenlegungen ausgewertet: Waymo gab zwischen April und Juni 2026 mehr als eine Million Dollar für Bundeslobbying aus — mehr als doppelt so viel wie im Vorjahreszeitraum. Für das erste Halbjahr summiert sich das auf gut zwei Millionen Dollar, ein Zuwachs von 93 Prozent. Damit liegt Waymo nahe am Niveau von Uber und deutlich über Zoox und Tesla. Allein in New York gab Waymo 2026 bereits über 500.000 Dollar aus, mehr als doppelt so viel wie Uber dort. Im Mai kam zusätzlich die Kanzlei Greenberg Traurig als Lobbyist hinzu.

Worum gestritten wird, ist konkreter als „Regulierung“. Waymo wirbt für einen bundesweiten Rahmen, der einen „faster route to fully driverless commercial services“ eröffnet. Uber setzt auf „hybrid networks“, in denen Robotaxis neben menschlichen Fahrern fahren — und wird dabei sehr konkret: In New Jersey fordern Ubers Lobbyisten, dass während einer dreijährigen Pilotphase mindestens 85 Prozent aller Fahrten weiterhin von Menschen erbracht werden müssen. Uber weist zurück, damit die Technologie ausbremsen zu wollen; man sei nicht „anti-AV or seeking to slow AV deployment“. Waymo hat zudem einen Fonds über 20 Millionen Dollar für betroffene Fahrer in Aussicht gestellt — das allerdings nach Angaben mit der Sache vertrauter Personen, nicht offiziell bestätigt.

Der Analyst Walter Piecyk von LightShed Partners bringt beide Stränge zusammen: „They've both stepped up lobbying and are pushing up against each other, which now appears to be hastening their divorce.“ Über die sich abzeichnende Trennung der beiden Partner haben wir am 27. Juli berichtet und die Wirtschaftlichkeit des Geschäfts in unserer Reportage vom 27. Juli durchgerechnet. Neu ist an dieser Meldung, dass die Eskalation jetzt in Dollarbeträgen aus Pflichtoffenlegungen nachlesbar ist statt nur aus anonymen Quellen.

Warum das über die Branche hinaus interessant ist. Hier lässt sich in Echtzeit beobachten, wie zwei Unternehmen mit derselben Technologie entgegengesetzte regulatorische Interessen entwickeln, weil ihre Geschäftsmodelle auseinanderlaufen: Wer die Fahrzeuge baut und betreibt, will den Menschen aus der Rechnung nehmen; wer die Vermittlungsplattform besitzt, verdient auch am Menschen. Die Menschenquote von 85 Prozent ist deshalb kein Sicherheitsargument, sondern ein Geschäftsmodellargument im Gewand eines Sicherheitsarguments — eine Unterscheidung, die bei künftigen Regulierungsdebatten zu KI allgemein nützlich sein dürfte.

Forschung · Medizin

Körperzusammensetzung aus zwei Smartphone-Fotos: Googles Modell schlägt die Waage — und schweigt zur Hautfarbe

Hintergrund & Analyse

Forschende von Google Research haben ein Verfahren vorgestellt, das aus Smartphone-Aufnahmen die Körperzusammensetzung schätzt — und daraus ein kardiometabolisches Risiko ableitet. Die Arbeit trägt den Titel „Beyond BMI: Smartphone Body Composition Phenotyping for Cardiometabolic Risk Assessment“ und liegt als Vorabpapier vor. Die deutschsprachigen Berichte von t3n und heise nennen keine einzige konkrete Genauigkeitszahl; wir haben sie deshalb dem Papier und dem Forschungsblog direkt entnommen.

Warum das medizinisch überhaupt interessant ist. Der Body-Mass-Index, der Standardmaßstab seit Jahrzehnten, setzt Gewicht ins Verhältnis zur Körpergröße und kann deshalb nicht zwischen Muskel und Fett unterscheiden — und schon gar nicht zwischen Fett unter der Haut und dem viszeralen Fett um die inneren Organe, das für das Stoffwechselrisiko entscheidend ist. Der klinische Referenzstandard dafür ist die DXA-Messung, eine Röntgen-Absorptiometrie, die Geräte, Personal und einen Termin braucht. Handelsübliche Körperfettwaagen behelfen sich mit einer Impedanzmessung, also einem schwachen Strom durch den Körper — bequem, aber ungenau.

Aufbau und Ergebnisse. Das Modell nutzt ein ResNet-50-Rückgrat und wurde dreistufig trainiert: Vortraining auf 35.323 Datensätzen der UK Biobank, Feinjustierung an einer klinischen Kohorte mit 677 Personen, unabhängige Prüfung an 132 weiteren Personen aus einer 30-wöchigen Längsschnittstudie in San Francisco. Gegen DXA als Referenz erreicht das Verfahren beim Körperfettanteil eine mittlere absolute Abweichung von 2,15 Prozent beziehungsweise 2,13 Prozent in der unabhängigen Kohorte — gegenüber 2,91 Prozent für die Impedanzmessung. Bei der Vorhersage von Insulinresistenz kommt das Fotoverfahren zusammen mit demografischen Angaben auf einen AUROC-Wert von 0,760; der Goldstandard DXA erreicht 0,773, demografische Angaben allein 0,692. Die Impedanzmessung brachte gegenüber der reinen Demografie-Grundlinie keine Verbesserung. Übersetzt: Das Foto kommt nah an das Röntgenverfahren heran, die Waage im Badezimmer trägt praktisch nichts bei.

Und jetzt die Lücke. Das Papier diskutiert keine Unterschiede nach Hautton und führt keine Fairness-Prüfung über ethnische oder soziodemografische Gruppen durch. Bei einem Verfahren, das aus Fotografien von Körpern Rückschlüsse zieht, ist das keine akademische Randfrage: Bildbasierte Medizinverfahren haben eine gut dokumentierte Geschichte systematisch schlechterer Ergebnisse für dunklere Hauttöne, von der Pulsoxymetrie bis zur Dermatologie. Die einzige demografische Einschränkung, die das Papier benennt, betrifft den höheren Frauenanteil in den Prüfkohorten. Solange dieser Nachweis fehlt, ist die Genauigkeitsangabe eine Aussage über die untersuchten Kohorten und nicht über die Bevölkerung.

Was das für die Praxis heißt. Es handelt sich ausdrücklich um einen Forschungsprototyp. Eine Produktankündigung gibt es nicht; als nächsten Schritt nennen die Autoren die Einbindung weiterer Datenquellen, nicht die Vermarktung. Die realistische Perspektive ist trotzdem greifbar: Ein Verfahren, das mit vorhandener Hardware auskommt, senkt die Hürde für Verlaufsmessungen erheblich — statt einmal im Jahr ein Termin, jederzeit eine Aufnahme. Genau daraus folgt aber auch die unangenehme Frage, die dieses Verfahren mit jedem anderen KI-Gesundheitswerkzeug teilt: Wo landen diese Bilder, und was passiert mit den daraus abgeleiteten Risikowerten, wenn sie einmal existieren? Ein Befund aus derselben Woche, den wir im nächsten Artikel behandeln, zeigt, dass diese Sorge nicht theoretisch ist.

Datenschutz · Medizin-KI

Wer selten vorkommt, ist am leichtesten zu finden: Nature-Studie zeigt fast hundertprozentige Wiedererkennung in medizinischen Trainingsdaten

Hintergrund & Analyse

Ein Forschungsteam um Moritz Knolle und Daniel Rückert (Technische Universität München), Georg Kaissis (Hasso-Plattner-Institut Potsdam) und Gruppen des Imperial College London hat in Nature eine Arbeit veröffentlicht, die untersucht, wie gut sich aus einem trainierten medizinischen KI-Modell zurückschließen lässt, wessen Daten in das Training eingeflossen sind.

Das Angriffsverfahren, kurz erklärt. Es heißt Membership Inference Attack und beantwortet eine einzige Frage: War der Datensatz dieser bestimmten Person Teil des Trainings? Das klingt harmlos, ist es aber nicht. Wenn ein Modell auf Daten von Patientinnen und Patienten einer HIV-Ambulanz oder einer psychiatrischen Klinik trainiert wurde, verrät allein die Mitgliedschaft im Trainingsdatensatz die Diagnose — unabhängig davon, ob das Modell sonst irgendetwas preisgibt. Anonymisierung hilft dagegen nicht, weil nicht die Daten ausgelesen werden, sondern das Verhalten des Modells ausgewertet wird.

Der Befund. Geprüft wurde an sieben etablierten medizinischen Datensätzen aus der Bildgebung, aus EKG-Aufzeichnungen und aus elektronischen Patientenakten. Die Angriffe sind besonders erfolgreich bei Personen, die in den Datensätzen unterrepräsentiert sind — gruppiert etwa nach Krankheitsbild, ethnischer Zuordnung, Geschlecht oder sozioökonomischem Status. Bei bestimmten Patientinnen und Patienten gelang die Zuordnung mit nahezu hundertprozentiger Sicherheit. Rückert dazu unmissverständlich: „This is not a tolerable risk. Health data is highly sensitive.“

Warum die Richtung des Effekts das eigentlich Beunruhigende ist. Ein Modell lernt seltene Fälle notgedrungen genauer auswendig als häufige — bei einem Muster, das tausendfach vorkommt, bildet es eine Verallgemeinerung; bei einem, das dreimal vorkommt, merkt es sich die Einzelfälle. Daraus folgt eine unangenehme Umkehrung des üblichen Fairness-Arguments: Dieselben Gruppen, die wegen ihrer Unterrepräsentation ohnehin schlechtere Vorhersagen bekommen, tragen zusätzlich das höchste Risiko, aus dem Modell heraus identifiziert zu werden. Wer die Datenbasis verbreitert, um Verzerrungen zu verringern, verringert damit auch dieses Risiko — beide Probleme haben dieselbe Wurzel.

Praktische Konsequenz. Für jede Organisation, die Modelle auf personenbezogenen Daten trainiert — und das betrifft weit über die Medizin hinaus Personal-, Versicherungs- und Kreditdaten —, ist die Lehre, dass die Löschung von Namen und Kennnummern kein Datenschutz ist, sobald das Modell selbst herausgegeben oder über eine Schnittstelle zugänglich gemacht wird. Die etablierte Gegenmaßnahme heißt differentielle Privatsphäre und kostet Genauigkeit; die Studie liefert das Argument dafür, diesen Preis in sensiblen Bereichen zu zahlen.

Plattformen · Inhalte

Eine Million Klicks auf „Seems like AI slop“: LinkedIn meldet 40 Prozent weniger Sichtbarkeit für maschinellen Füllstoff

Hintergrund & Analyse

LinkedIn hat am 30. Juli im Menü jedes Beitrags eine Meldeoption mit dem Wortlaut „Seems like AI slop“ eingeführt — sinngemäß: „wirkt wie maschineller Füllstoff“. Hari Srinivasan, Chief Product Officer der Plattform, hat nun eine erste Bilanz vorgelegt: Der Knopf wurde in den ersten zwei Wochen über eine Million Mal betätigt. Zur Wirkung sagt er: „Members are now experiencing 40% less views on what we classify as AI slop from just a few weeks ago.“

Was der Knopf tut — und was nicht. Er löscht nichts. Er erzeugt ein Nutzersignal, das in LinkedIns Klassifikationsmodelle einfließt. Ein einzelner Klick wirkt vor allem persönlich: Wer meldet, sieht künftig weniger von diesem Verfasser. Erst viele gleichlautende Meldungen drücken die Reichweite eines Beitrags über das eigene Netzwerk hinaus. LinkedIn gibt an, Schutzmechanismen gegen den Missbrauch der Funktion als Waffe eingebaut zu haben. Parallel hat die Plattform ihr eigenes Schreibwerkzeug „Enhance“, das komplette Texte erzeugte, auf reine Korrekturfunktionen zurückgestutzt und blockiert nach eigenen Angaben täglich Hunderttausende automatisierter Kommentarversuche.

Zur Größenordnung des Problems, mit ausdrücklichem Vorbehalt: Die kursierende Angabe, 41 Prozent der längeren Beiträge auf LinkedIn seien vollständig maschinell erzeugt, stammt von Pangram, einem Anbieter von KI-Erkennungssoftware. Das Unternehmen hat ein geschäftliches Interesse daran, dass das Problem groß erscheint, und eine unabhängige Bestätigung der Zahl liegt nicht vor. Wir nennen sie deshalb, aber nicht als gesicherten Befund. Zu den grundsätzlichen Grenzen solcher Erkennungsverfahren haben wir am 21. August ausführlich geschrieben.

Der Knopf ist kein Einzelfall, sondern ein Muster. Spotify hat nach eigenen Angaben im vergangenen Jahr über 75 Millionen maschinell erzeugte Spam-Titel entfernt und Filter gegen Massen-Uploads eingeführt. YouTube beendete laut einem Schreiben von Neal Mohan in einer sechsmonatigen Aktion über 130.000 Kanäle wegen maschinellen Spams. Pinterest kennzeichnet KI-veränderte Inhalte mit einem eigenen Label und lässt Nutzer einstellen, wie viel davon sie sehen wollen. Auch die New York Times hat das Thema am 17. August unter dem Titel „Sick of A.I. Slop? So Are Tech Giants.“ aufgegriffen — jener Text, den Golem am 21. August in der englischen Fassung übernommen hat.

Die Ironie liegt auf der Hand und ist trotzdem lehrreich. Dieselben Plattformen, die KI-Schreibhilfen in ihre Oberflächen eingebaut haben, um die Beitragsmenge zu erhöhen, bauen nun Werkzeuge, um die Folgen einzudämmen. Der Grund ist nicht Reue, sondern Ökonomie: Das Geschäftsmodell dieser Dienste beruht auf Verweildauer, und Verweildauer bricht ein, wenn die Zeitleiste sich nicht mehr lohnt. Für Unternehmen, die diese Kanäle bespielen, folgt daraus etwas sehr Konkretes: Reichweite wird zunehmend danach zugeteilt, ob ein Beitrag als maschinell erzeugt wahrgenommen wird — und diese Wahrnehmung entscheiden Leser mit einem Klick, nicht ein Detektor.

Cloud · Wettbewerb

Meta baut die größten eigenen Rechenzentren der Branche — und kauft für hunderte Millionen bei Microsoft ein

Hintergrund & Analyse

Quellenhinweis vorweg: Diese Meldung beruht auf einem Bloomberg-Bericht vom 20. August, der sich auf anonyme Quellen stützt. Meta und Microsoft haben beide eine Stellungnahme abgelehnt. Alle weiteren Veröffentlichungen dazu — auch die deutschsprachige bei Golem — geben denselben Bericht wieder; eine zweite, unabhängig recherchierte Quelle existiert nicht. Wir behandeln die Angaben entsprechend.

Meta gibt danach mehrere hundert Millionen Dollar jährlich für Microsofts KI-Dienste auf Azure aus und verarbeitet über die Plattform Billionen von Token pro Woche. Genauere Zahlen nennt der Bericht nicht. Bezogen wird der Zugang zu fremden Modellen — unter anderem von OpenAI — über Microsofts Marktplatz Foundry. Bisher galt ByteDance als größter Kunde dieses Marktplatzes; Meta reiht sich nun mit Adobe und anderen in die Spitzengruppe ein.

Warum das zunächst widersprüchlich wirkt. Meta betreibt einen der aufwendigsten eigenen Rechenzentrumsausbauten der Branche, entwickelt mit MTIA eigene Beschleunigerchips und arbeitet an einem eigenen Cloud-Angebot, das künftig genau mit Foundry konkurrieren dürfte. Dass ein solches Unternehmen bei einem direkten Wettbewerber einkauft, verlangt eine Erklärung.

Die plausibelste steht im Bericht selbst. Meta nutzt den Zugang demnach vor allem, um die Ausgaben der eigenen Modelle zu bewerten — also zum Vergleich. Wer ein konkurrenzfähiges Modell bauen will, braucht laufenden Zugriff auf die Konkurrenz, und zwar nicht in Form von Benchmarkzahlen, sondern in Form echter Ausgaben zu echten Anfragen. Hinzu kommt Unterstützung bei der Softwareentwicklung. Beides sind Anwendungen, für die sich ein eigener Aufbau nicht lohnt.

Was daran über den Einzelfall hinausweist. Der Begriff dafür ist Coopetition — gleichzeitige Konkurrenz und Kooperation. In der KI-Infrastruktur ist sie inzwischen der Normalfall: Nvidia investiert in seine eigenen Kunden, Microsoft verkauft Rechenkapazität an Unternehmen, mit denen es im Produktgeschäft konkurriert, und Modellanbieter hosten die Modelle ihrer Wettbewerber. Für Einkäufer in Unternehmen ist die praktische Lehre unspektakulär, aber nützlich: Wenn selbst Meta es für sinnvoll hält, Modelle mehrerer Anbieter parallel zu beziehen statt sich festzulegen, ist die Ein-Anbieter-Strategie im eigenen Haus zumindest begründungspflichtig. Dass die Wechselkosten dabei weniger beim Modell als in der Schicht darum herum liegen, ist das Thema der Reportage dieser Ausgabe.

Robotik · Fertigung

Bühl im Nordschwarzwald wird Bosch-Werk für humanoide Roboter — gefertigt wird für ein britisches Einhorn

Hintergrund & Analyse

Zur Einordnung vorab: Die Partnerschaft selbst wurde bereits im Mai 2026 bekannt gegeben, der zugrunde liegende Praxistest fand im März statt. Neu an der Meldung vom 21. August sind eine eigene Bestätigung mit frischem O-Ton eines Bosch-Sprechers gegenüber Golem sowie die inzwischen erreichte Bewertung des Auftraggebers. Wir machen das transparent, statt eine drei Monate alte Ankündigung als neu zu verkaufen.

Bosch wird im Werk Bühl im Nordschwarzwald humanoide Roboter fertigen — nicht als eigenes Produkt, sondern als Auftragsfertiger für das britische Robotikunternehmen Humanoid, das 2024 von Artem Sokolov gegründet wurde. Gebaut wird der HMND 01. Es ist die erste Bosch-Fertigungsstätte für humanoide Roboter weltweit; die Serienfertigung soll ab August 2027 anlaufen, geplant sind zunächst mehrere hundert Einheiten.

Der Bosch-Sprecher gegenüber Golem: „Nach erfolgreichen Praxistests im Werk in Bühl übernimmt Bosch für Humanoid künftig die Auftragsfertigung von Robotern. Darüber hinaus prüfen die beiden Unternehmen auch die Integration von Bosch-Technologien, darunter Aktoren, Motoren, Sensoren und andere Komponenten, in humanoiden Robotern. Wir können bestätigen, dass die Auftragsfertigung im Laufe des Jahres 2027 beginnen soll. Angaben zu Stückzahlen oder Mitarbeitenden machen wir aktuell keine.“

Der Praxistest, der vorausging, war bewusst unglamourös: HMND-01-Roboter transportierten im Werk Bühl selbständig Kartons in fünf verschiedenen Größen und Gewichten vom Förderband auf Transportwagen. Gesteuert werden die Maschinen über KinetIQ, das hauseigene KI-Rahmenwerk von Humanoid; nähere Angaben zur Architektur nennt die Meldung nicht. Zielanwendungen sind zunächst Fabrik und Logistik.

Die drei Rollen, die Bosch hier gleichzeitig einnimmt, sind das eigentlich Bemerkenswerte. Der Konzern ist Fertiger, ist am Auftraggeber finanziell beteiligt und will zusätzlich eigene Komponenten in das Produkt bringen. Das ist keine klassische Lohnfertigung, sondern der Versuch, sich in einer entstehenden Wertschöpfungskette gleich an drei Stellen zu positionieren — bei einem Produkt, dessen Marktreife noch offen ist. Humanoid wurde im Juli 2026 nach einer Finanzierungsrunde mit 1,19 Milliarden Euro bewertet und gilt damit als erstes europäisches Einhorn in der humanoiden Robotik.

Wie weit die Technik insgesamt tatsächlich ist, haben wir in unserer Reportage vom 27. Mai untersucht — mit dem Ergebnis, dass zwischen beeindruckenden Vorführungen und belastbarem Dauerbetrieb weiterhin eine erhebliche Lücke klafft. Dass Bosch zunächst mehrere hundert und nicht mehrere zehntausend Einheiten plant, passt zu diesem Bild.

Reportage

Vierzigfache Kosten, null Prozentpunkte mehr Können: Was die Schicht um das Modell wirklich leistet

Weiterlesen →

Tool-Radar

Neue und trendende KI-Tools des Tages

fx Logo
Ein sehr kleiner quelloffener Codeagent, den Vercel Labs in Zig geschrieben und als natives Binärprogramm von rund sechs Megabyte veröffentlicht hat.
Der Reiz liegt in der Abwesenheit von allem: kein Editor, keine Laufzeitumgebung, kein Anmeldevorgang — das Programm startet in Mikrosekunden und arbeitet modellunabhängig gegen lokale wie entfernte Inferenzdienste. Nach Angaben von Vercel verlassen weder Quelltext noch Anweisungen den Rechner in eine andere Richtung als zum gewählten Modellanbieter. Für Teams, die einen Agenten in eine Fertigungsstrecke einbauen wollen, ist die geringe Angriffsfläche das eigentliche Argument.
Dev-Tools · Quelloffene Freigabe 17. August 2026, Product-Hunt-Start 21. August
Actx0 Logo
Verwaltete Gedächtnisinfrastruktur, die KI-Agenten ein dauerhaftes Erinnerungsvermögen über Sitzungen, Anwendungen und Werkzeuge hinweg gibt.
Statt Vektordatenbanken selbst zu betreiben oder Anweisungen mit altem Kontext aufzublähen, extrahiert der Dienst die relevanten Fakten und liefert sie im Millisekundenbereich zurück. Das trifft genau den Punkt, an dem die meisten Agentenprojekte scheitern — nicht am Modell, sondern daran, dass zwischen zwei Sitzungen alles vergessen ist. Der Anbieter bezeichnet den jetzigen Stand ausdrücklich als „Tag 1 einer Roadmap“; von einem kleinen Team um den Entwickler Ahmed.
Agenten · Product-Hunt-Start 21. August 2026
Mindcase Logo
Agenten, die strukturierte Webdaten aus Quellen wie LinkedIn, Amazon, Google Maps oder Instagram auf Zuruf oder über eine Schnittstelle liefern.
Neu ist nicht das Produkt, sondern der Zugang: Der Dienst war bislang geschlossen und wurde am 21. August für die Allgemeinheit geöffnet. Mitgeliefert werden über 75 vorgefertigte Abrufmodule, sodass die übliche Bastelei an Einzelabfragen entfällt. Gründer ist Saurabh Shubham; als Referenzkunden werden BCG und Bain genannt. Wer solche Werkzeuge einsetzt, sollte die Nutzungsbedingungen der jeweiligen Quellplattform prüfen — die Rechtslage beim Auslesen fremder Seiten ist von Fall zu Fall verschieden.
Business · Öffentliche Freigabe 21. August 2026
MeetStream AI Logo
Einheitliche Schnittstelle, über die Software-Teilnehmer Besprechungen in Zoom, Google Meet und Teams beitreten, mitschneiden und live über 50 Datenpunkte auslesen.
Der Unterschied zur vorherigen Fassung ist eine Sprachschicht: Der Agent kann im laufenden Gespräch selbst sprechen, statt nur zuzuhören und hinterher zusammenzufassen. Damit verschiebt sich die Rolle vom Protokollanten zum Teilnehmer — mit allen Fragen zur Einwilligung der übrigen Anwesenden, die das aufwirft und die der Anbieter nicht für Sie beantwortet.
Business · Product-Hunt-Start 20. August 2026
Aloud Logo
Zeichnet Bildschirm, Stimme und Mitschrift auf, während man die eigene Anwendung durchspricht, und macht daraus fertige Arbeitsaufträge für Claude Code, Cursor oder Codex.
Die Mitschrift läuft vollständig auf dem Gerät über ein lokales Whisper-Modell, es wird also nichts hochgeladen. Interessanter ist die Arbeitsweise: Bei Mehrdeutigkeiten fragt das Programm gezielt nach, statt zu raten, und liefert am Ende eine gegliederte Aufgabenliste statt einer rohen Abschrift. Das schließt die Lücke zwischen „ich sehe den Fehler“ und „ich habe ihn so beschrieben, dass ein Agent ihn beheben kann“.
Produktivität · Product-Hunt-Start 20. August 2026
NobodyWho Logo
Quelloffene Inferenzbibliothek, mit der Sprachmodelle vollständig offline auf dem Endgerät laufen — unter anderem als Erweiterung für die Spiele-Engine Godot.
Der erste stabile Stand deckt sechs Plattformen gleichzeitig ab: Swift, Kotlin, Flutter, React Native, Python und Godot. Für Spiele ist das mehr als eine Randnotiz, weil Dialoge von Nebenfiguren damit ohne jeden Serveraufruf entstehen — keine Latenz, keine laufenden Kosten pro Gespräch, keine Datenschutzfrage. Getragen wird das Projekt von einem kleinen Open-Source-Team.
Kreativ · Erster stabiler Stand, Product-Hunt-Start 21. August 2026

Aus der Werkstatt

YouTube-Empfehlungen: Tutorials, Erklärungen und Werkzeuge

Qwen 3.8 Locally: How Much Can You Actually Trust It?
Tutorial
Zero to MVP · 10:30
Die übliche Frage bei lokalen Modellen lautet, ob sie ein Spitzenmodell ersetzen können — hier wird die nützlichere gestellt: Wie komplex darf eine Aufgabe werden, bevor ein lokal laufendes 27B-Modell abreißt? Der Creator arbeitet sich stufenweise von einer simplen Uhr bis zu einer vollständigen Full-Stack-Anwendung für Nachrichtenaggregation vor und markiert, wo genau die Qualität kippt. Sehenswert ist das wegen der Methode: ein gestufter Belastungstest mit benennbarer Abbruchkante statt einer pauschalen Empfehlung. Der Kanal hat 29.900 Abonnenten; ein Drittsponsoring liegt nicht vor, in der Beschreibung steht nur Eigenwerbung für Newsletter und Patreon.
NEW Deepseek Agent Harness EXPLAINED (deep dive)
Tutorial
Stephen G. Pope · 15:31
Eine ruhige technische Zerlegung des Agentenloops im DeepSeek-Harness: das Prinzip Konfiguration statt Code, das dynamische Nachladen von Werkzeugen zur Laufzeit und Änderungen an der Oberfläche allein über die Konfiguration. Das Video passt unmittelbar zum Leitartikel und zur Reportage dieser Ausgabe, weil es an einem offenen, nachlesbaren Beispiel zeigt, woraus die Schicht um das Modell herum tatsächlich besteht. Wer verstehen will, wie Cursor, Claude Code oder Codex unter der Haube arbeiten, bekommt hier den kompakteren Einstieg als über die Dokumentation. Der Kanal hat 90.000 Abonnenten; kein Drittsponsoring, nur Eigenwerbung für die eigene Community.