· 9 Artikel + Reportage + Tool-Radar + Werkstatt

Ausgabe vom 15. August 2026

Maschinell recherchiert, menschlich relevant.

Modelle · Offene Gewichte

Das beste offene Modell zum Schwachstellenfinden kommt aus Peking — und hält seine Gewichte freiwillig zwei Wochen zurück

Hintergrund & Analyse

Das chinesische Unternehmen Z.ai (früher Zhipu AI) hat am 14. August GLM-5.3 veröffentlicht. Technisch ist es kein neues Modell: Das Basismodell bleibt dasselbe wie bei GLM-5.2 — ein Mixture-of-Experts-Aufbau mit 743 Milliarden Parametern, von denen pro Token rund 40 Milliarden aktiv sind. Jeder Leistungsgewinn stammt nach Firmenangabe ausschließlich aus skaliertem Post-Training, also aus der Nachschulung des fertigen Basismodells in vielfältigeren, professionelleren Arbeitsumgebungen.

Die Zahlen zum Programmieren sind bemerkenswert: Terminal-Bench 3.0 springt von 4,6 auf 28,3 Punkte, DeepSWE v1.1 von 46,2 auf 66,9, AutomationBench liegt bei 48,2 Prozent. Sämtliche dieser Werte stammen aus Z.ais eigener Ankündigung; eine unabhängige Nachmessung liegt zum Redaktionsschluss nicht vor — was auch daran liegt, dass es noch nichts zum Nachmessen gibt. Und genau da beginnt die eigentliche Geschichte.

Interessanter als die Coding-Werte ist nämlich eine zweite Benchmark-Familie. Auf CyberGym erreicht GLM-5.3 84,5 Prozent, gegenüber 77,2 Prozent beim Vorgänger. Damit liegt es knapp vor den beiden besten geschlossenen Modellen des Vergleichsfelds, für die Z.ai 83,8 und 83,6 Prozent angibt. Welche Modelle das genau sind, geben die vorliegenden Berichte widersprüchlich wieder, weshalb wir sie hier nicht benennen. Zur Einordnung, weil die beiden Benchmarks oft verwechselt werden: CyberGym misst, ob ein Modell in offen einsehbarem Quellcode Sicherheitslücken findet und bestätigt — das ist die Arbeit eines Prüfers. ExploitBench misst, ob es diese Lücken auch ausnutzen kann — das ist die Arbeit eines Angreifers. Dort kommt GLM-5.3 auf 54,4 Prozent nach zuvor 24,4 und bleibt damit deutlich hinter dem stärksten geschlossenen Modell des Vergleichsfelds (78,0). Das Modell ist also ein Weltklasse-Finder und ein mittelmäßiger Ausnutzer.

Ungewöhnlich ist, wie Z.ai das kommentiert. In der Ankündigung heißt es, die Cyber-Fähigkeit habe sich „schneller entwickelt, als wir erwartet haben"; das Modell habe begonnen, „über mehrere Stufen der Ausnutzung hinweg zu schließen und zusammenhängende Pläne für vollständige Angriffsketten zu bilden". Das war laut Firmenangabe nicht das Trainingsziel. Ein Anbieter, der eine unbeabsichtigte Offensivfähigkeit seines eigenen Produkts öffentlich als solche benennt, ist in dieser Branche selten genug, um es festzuhalten.

Belege aus dem Feld liefert Z.ai gleich mit: Seit GLM-5.2 habe man mit den Modellen 2.436 Schwachstellen in 269 Open-Source-Projekten gefunden, davon 1.097 als kritisch oder hoch eingestuft. Namentlich genannt werden ein Use-after-free im Linux-Kernel, ein Speicherfehler in Apples WebKit-Engine und ein Fehler in der Parameterprüfung von FreeBSD; der Großteil der Funde liegt noch unter Embargo, bis die Projekte gepatcht haben. Unabhängig davon berichtete der Sicherheitsforscher Joshua Saxe, GLM-5.3 habe eine ernste Schwachstelle im KI-Editor Cursor gefunden, die vertraulich gemeldet und mit dem Cursor-Team behoben wurde. Diese Angaben sind glaubwürdig, aber nicht extern geprüft.

Der eigentliche Bruch mit der bisherigen Praxis ist der Zeitplan. Zum Start ist GLM-5.3 nur über den kostenpflichtigen GLM Coding Plan und die Entwicklungsumgebung ZCode nutzbar. API-Zugang und offene Gewichte kommen gestaffelt, etwa zwei Wochen später — Z.ai nennt als Grund ausdrücklich die noch laufende Sicherheitsauswertung und Härtung. Für ein Haus, dessen Geschäftsmodell auf sofort herunterladbaren Gewichten beruht, ist das ein Novum. Der Werbeslogan des Modells lautet dabei „Built to Code. Ready for Cyber Defense." — Verteidigung, nicht Angriff. Nur lässt sich ein Modell, das Lücken zuverlässig findet, nicht so bauen, dass es nur die richtigen Leute findet.

Damit steht die Meldung in einem regulatorischen Zusammenhang, der ihr eine unangenehme Pointe gibt. Der von Washington Anfang August finalisierte Prüfrahmen für Frontier-Modelle testet ausschließlich Cyberfähigkeiten — und nimmt ausschließlich Open-Weight-Modelle vollständig aus, wie wir am 6. August beschrieben haben. Beim Vorgänger GLM-5.2 hatte der SaferAI-Risikobericht vermerkt, dass das Modell zwar zwei bis vier Monate Rückstand auf die Spitze habe, aber kein einziges Angriffsziel verweigerte. OpenAI wiederum hat sein unveröffentlichtes Modell ASTRA wegen genau solcher Fähigkeiten ausgebremst — als geschlossener Anbieter, der die Notbremse jederzeit ziehen kann.

Nüchtern zusammengefasst: Die einzige wirksame Sicherheitsschranke vor der Veröffentlichung des derzeit stärksten offenen Schwachstellenfinders ist die freiwillige Entscheidung eines Unternehmens in Peking, zwei Wochen zu warten. Kein amerikanisches Verfahren greift hier, weil offene Modelle ausgenommen sind. Der EU-AI-Act greift bei den Pflichten für Modelle mit systemischem Risiko zwar grundsätzlich auch für offene Gewichte, ist aber kein Freigabeverfahren vor der Veröffentlichung. Wer bislang argumentiert hat, offene Gewichte seien harmlos, weil sie der Spitze hinterherlaufen, muss das für die Disziplin Schwachstellensuche in zwei Wochen neu begründen.

Für Unternehmen ist die praktische Konsequenz weniger dramatisch, aber konkret. Erstens: Wer offene Modelle betreibt, sollte davon ausgehen, dass ab Ende August ein frei herunterladbares Modell auf dem eigenen Quellcode Lücken findet, die bisher niemand gefunden hat — das gilt für die eigene Sicherheitsabteilung ebenso wie für alle anderen. Zweitens: Der sinnvolle Zeitpunkt, das defensiv zu nutzen, ist vor dem Gewichte-Release, nicht danach. Drittens: Die Zwei-Wochen-Frist ist eine Selbstverpflichtung ohne Prüfinstanz. Man sollte sie zur Kenntnis nehmen, aber nicht zur Grundlage einer Planung machen.

Infrastruktur · Europa

Mistral liefert jetzt ein chinesisches Modell aus — und nennt das europäische Souveränität

Hintergrund & Analyse

Am 11. August hat Mistral drei Dinge auf einmal angekündigt, die zusammen eine strategische Neuausrichtung ergeben. Erstens: Regional Endpoints sind allgemein verfügbar — Kunden können festlegen, ob ihre Anfragen in Europa oder in den USA verarbeitet werden, was Datenresidenz-Anforderungen erfüllbar macht. Zweitens: ein Priority Tier mit zugesicherter Verfügbarkeit und eigenen Ratenbegrenzungen für kritische Arbeitslasten, vorerst als öffentliche Vorschau. Preise nennt die Ankündigung für beides nicht.

Drittens, und das ist der eigentliche Bruch: Mistral hostet erstmals ein fremdes offenes Modell auf der eigenen Plattform — und zwar GLM-5.2 von Z.ai, unverändert, aus China. Dasselbe Haus also, dessen Nachfolgemodell wir im Leitartikel dieser Ausgabe behandeln.

Dazu kommt eine Infrastruktur-Initiative: die European Compute Units, eine Koalition, die bis 2030 bis zu ein Gigawatt langfristige europäische Rechenkapazität sichern soll. Unterzeichnet haben unter anderem Amadeus (Luis Maroto), ASML (Christophe Fouquet), Capgemini (Aiman Ezzat), die Caisse des Dépôts (Olivier Sichel) und CMA CGM (Rodolphe Saadé). Das ist bemerkenswert nicht wegen der Zahl — ein Gigawatt bis 2030 ist im Vergleich zu den amerikanischen Ausbauplänen bescheiden — sondern wegen der Zusammensetzung: Das sind Abnehmer, keine Anbieter.

Der t3n-Autor Florian Zandt hat die Ankündigung am 14. August als „Kapitulation" gelesen: Mistral gebe damit den Anspruch auf, ein „ChatGPT aus Europa" zu bauen. Die Wertung stammt vom Kommentator, nicht von Mistral — ein entsprechendes Zitat aus dem Unternehmen gibt es nicht. In der Sache trifft die Beobachtung aber einen Punkt: Wer fremde Modelle ausliefert, verkauft nicht mehr primär Modellqualität, sondern Betrieb unter europäischer Kontrolle.

Ob das ein Rückzug oder eine Positionierung ist, hängt davon ab, wo man den Wert vermutet. Die Modellschicht ist inzwischen der Teil des Marktes mit dem härtesten Preisverfall und der kürzesten Halbwertszeit — Google ersetzt sein Arbeitspferd im Dreiwochentakt, die Tokenpreise fallen quer durch die Branche. Die Schicht darunter — Rechenkapazität, Datenresidenz, garantierte Verfügbarkeit — ist träger, kapitalintensiver und für europäische Kunden regulatorisch nicht ersetzbar. Mistral verlässt also das Feld mit dem stärksten Wettbewerb und besetzt eines, in dem Herkunft ein Kaufargument ist.

Für Entscheider in Europa ergibt sich daraus ein konkreter Prüfauftrag. Wenn ein europäischer Anbieter ein chinesisches Modell auf europäischer Infrastruktur ausliefert, ist die Datenverarbeitung europäisch — die Modellgewichte und ihr Trainingsprozess sind es nicht. Für DSGVO-Fragen ist das ein echter Fortschritt. Für Fragen der Lieferkettensicherheit oder der Modellherkunft, wie sie manche Branchenaufsichten inzwischen stellen, ist es keine Antwort. Beide Kriterien sollte man getrennt bewerten, statt sie unter dem Wort Souveränität zu vermischen.

Märkte · Preise

Die US-Labore kappen die Mitte und verteidigen die Spitze

Hintergrund & Analyse

Am 14. August erschien in der Financial Times — hierzulande über Ars Technica und Golem verbreitet — eine Bestandsaufnahme des Preiskampfs zwischen den führenden US-Laboren. Die Meldung hat keinen einzelnen neuen Preisschritt zum Anlass; ihr Wert liegt im Gesamtbild, und das ist deutlicher, als die Einzelmeldungen der vergangenen Wochen vermuten ließen.

Die harten Zahlen: OpenAI senkte den Preis für GPT-5.6 Luna um 80 Prozent — von einem Dollar auf 0,20 Dollar je Million Eingabe-Token und von sechs auf 1,20 Dollar je Million Ausgabe-Token. Anthropic brachte Claude Opus 5 zu 5 Dollar Eingabe und 25 Dollar Ausgabe an den Start, also zum halben Preis des hauseigenen Spitzenmodells Fable 5. Und in der Woche vor der Veröffentlichung sagte Anthropic eine für September geplante Preiserhöhung für Sonnet 5 ab. Der Token-Preisindex des Datenanbieters Silicon Data weist über alle führenden US-Modelle hinweg einen Rückgang von knapp einem Viertel seit Mitte Juli aus.

Der Auslöser wird offen benannt: chinesische offene Modelle. Unternehmen wie DoorDash und Airbnb haben nach eigenen Angaben begonnen, chinesische Modelle einzusetzen, um Rechnungen zu begrenzen. Verstärkt wird der Effekt dadurch, dass OpenAI und Anthropic Geschäftskunden zunehmend von Pauschalabonnements auf nutzungsabhängige Abrechnung umstellen — was steigende Rechnungen sichtbarer macht und Ausweichbewegungen auslöst.

Eine methodische Warnung liefert der Artikel gleich mit, und sie ist wichtiger als die Preistabelle: Listenpreise pro Token sind kein Vergleichsmaßstab. Ein fähigeres Modell löst eine Aufgabe oft mit weniger Token und weniger Anläufen, und die meisten Modelle laufen zusätzlich in verschiedenen Effort-Stufen, die Rechenaufwand und Ergebnis gleichermaßen verschieben. Artificial Analysis misst entsprechend: Anthropics Opus 5 auf mittlerer Stufe liefert ähnliche Leistung und ähnliche Kosten pro Aufgabe wie Moonshots Kimi K3 auf höchster Stufe. GPT-5.6 Luna auf höchster Stufe kommt an DeepSeeks V4 Flash heran, kostet pro Aufgabe aber knapp das Doppelte. Warum diese Rechnung wichtiger ist als der Stückpreis, haben wir in unserer gestrigen Reportage ausführlich behandelt.

Anthropic und OpenAI wollten sich nicht äußern. Eine Anthropic nahestehende Person erklärte lediglich, die Positionierung von Opus 5 unterhalb des Flaggschiffs sei die normale Struktur der Modellfamilie und habe „keinen Zusammenhang mit Wettbewerbern". Die aufschlussreichste Einordnung stammt von einem Kunden: Mantas Lukauskas, KI-Verantwortlicher beim Hosting-Anbieter Hostinger, weist darauf hin, dass die Preise für die allerbesten Modelle „gleichbleibend bis steigend" seien, und fasst zusammen: „Die US-Labore haben die Mitte gekappt und verteidigen die Spitze."

Für die Budgetplanung heißt das etwas Unbequemes. Wer heute günstiger einkauft, tut das in der mittleren Leistungsklasse — dort, wo der Wettbewerb mit offenen chinesischen Modellen stattfindet. Wer Spitzenmodelle braucht, sieht keinen Preisverfall und sollte auch keinen einplanen. Beide Sätze gleichzeitig zu berücksichtigen ist die eigentliche Aufgabe, und sie fällt leichter, wenn die eigene Architektur einen Modellwechsel pro Anwendungsfall zulässt statt nur pro Unternehmen.

Sicherheit · Forschung

45 Sekunden und drei Cent: Was personalisiertes Phishing kostet, wenn lokale Modelle es schreiben

Hintergrund & Analyse

Auf dem 35. USENIX Security Symposium in Baltimore, das vom 12. bis 14. August lief, haben Forschende der TU Berlin, des BIFOLD, von Inria und der Ruhr-Universität Bochum eine Feldstudie vorgestellt, die eine oft behauptete These erstmals sauber beziffert. Autoren sind Stefan Czybik, Anne Josiane Kouam und Konrad Rieck (alle BIFOLD/TU Berlin beziehungsweise Inria) sowie Peter Heubl und Jan Magnus Nold (Ruhr-Universität Bochum).

Der Aufbau: 7.700 Teilnehmende an einer Partneruniversität erhielten Phishing-Mails. Aus der bloßen E-Mail-Adresse heraus sammelte eine automatisierte Pipeline öffentlich verfügbare Informationen über die Zielperson und verfasste daraus eine maßgeschneiderte Mail — Spear Phishing genannt, also der gezielte Angriff auf eine einzelne Person statt der Massenversand.

Die Ergebnisse in einer Zeile: Generische Massen-Mails erreichten eine Klickrate von 3,9 Prozent. Automatisch personalisierte Mails kamen auf 10,0 Prozent — nahezu eine Verdreifachung. Von Hand geschriebene Spear-Phishing-Mails eines erfahrenen Sicherheitsforschers erreichten mit 24,2 Prozent weiterhin gut das Zweieinhalbfache der automatisierten Variante. Die Maschine ist also noch nicht so gut wie ein guter Mensch.

Nur ist das die falsche Vergleichsgröße. Der eigentliche Befund steht in der Kostenrechnung. Für die manuelle Variante veranschlagten die Forschenden fünf Minuten Recherche und zwei Minuten Schreiben pro Mail; für 100 Ziele ergab das rund elf Stunden und 40 Minuten Arbeitszeit eines Fachmanns. Die automatisierte Pipeline erzeugte 4.010 Mails in etwa 50,5 Stunden auf einer einzigen Nvidia A40 — rund 45 Sekunden pro Mail und damit fast neunmal schneller als der Mensch, bei Kosten von etwa drei Cent pro Mail. Und der Ablauf ist vollständig parallelisierbar.

Für die Sicherheitslage ist ein technisches Detail der Studie das wichtigste: Es kamen ausschließlich lokal betriebene offene Modelle zum Einsatz — Varianten von Llama, DeepSeek, Gemma, Mistral und Phi, orchestriert über LangChain. Kein kommerzieller Dienst, keine API, kein Anbieter, der etwas hätte blockieren können. Damit greift die gesamte Schutzschicht der geschlossenen Anbieter — Nutzungsbedingungen, Missbrauchserkennung, Kontosperren — an dieser Stelle prinzipiell nicht. Das ist derselbe strukturelle Punkt, der auch im Leitartikel dieser Ausgabe steht, nur von der anderen Seite betrachtet.

Die Autoren nennen zwei Gegenmaßnahmen, und beide sind für Unternehmen unmittelbar umsetzbar. Erstens: die Menge öffentlich verfügbarer Information begrenzen, die sich einer E-Mail-Adresse zuordnen lässt — die Pipeline lebt genau davon. Bemerkenswert dabei ist ein Nebenbefund: Personen mit geringer bis mittlerer öffentlicher Informationsmenge waren am anfälligsten, nicht die mit der größten. Zweitens: personalisiertes Phishing in die Awareness-Schulungen aufnehmen. Wer sein Personal weiterhin an Massen-Mails mit Rechtschreibfehlern trainiert, trainiert auf ein Angriffsmuster, das drei Cent pro Kopf teurer geworden ist — und dabei aus der Mode kommt.

Kennzeichnung · Google

Google macht sein sichtbares Wasserzeichen abschaltbar — das unsichtbare bleibt

Hintergrund & Analyse

Google hat am 14. August in der Gemini-App und im Videowerkzeug Flow eine Einstellung namens „Media watermark" eingeführt. Ist sie ausgeschaltet, verschwindet das sichtbare Funkel-Symbol aus allen generierten Inhalten — betroffen sind Bilder aus dem Bildmodell, Videos und generierte Musik. Der Rollout läuft nach Firmenangabe über die folgenden Tage; in Indien, Südkorea und Vietnam ist die Option zunächst nur für Abonnenten von Google AI Ultra verfügbar.

Wichtig ist die Abgrenzung, die in der Kurzberichterstattung leicht untergeht: Das unsichtbare Wasserzeichen SynthID bleibt immer erhalten, ebenso die C2PA-Herkunftsmetadaten. Der Schalter ändert also nichts an der maschinellen Nachweisbarkeit, sondern nur an der optischen Kennzeichnung für Menschen. Das ist ein realer Unterschied — und zugleich eine Unterscheidung, die im Alltag kaum jemand trifft.

Genau darin liegt der Widerspruch. Ein sichtbares Wasserzeichen informiert jeden Betrachter ohne Werkzeug. Ein unsichtbares informiert nur denjenigen, der ein Prüfwerkzeug hat, es kennt und benutzt. Wer die sichtbare Kennzeichnung abschaltbar macht, verlagert die Beweislast vom Ersteller zum Betrachter. Googles Argument dafür ist nachvollziehbar: Professionelle Nutzer, die generierte Elemente in eigene Produktionen einbauen, brauchen saubere Ausgangsdateien, und wer die Markierung wegretuschieren will, schafft das ohnehin in wenigen Minuten.

Der Vorgang reiht sich in eine Debatte ein, die diese Woche schon zweimal lief. Anthropic hatte am 11. August begonnen, unsichtbare Zeichen in Claude-Textausgaben zu schreiben; binnen zwei Tagen kursierten Werkzeuge zum Entfernen, begleitet von deutlicher Nutzerkritik. Google zieht bei sichtbaren Markierungen nun die Konsequenz aus derselben Dynamik — allerdings freiwillig und mit dem Hinweis, dass die belastbarere Kennzeichnung ohnehin die unsichtbare sei.

Für Unternehmen, die generierte Medien veröffentlichen, ändert das die Rechtslage nicht. Die Kennzeichnungspflicht nach Artikel 50 der EU-KI-Verordnung gilt seit dem 2. August und knüpft an den Anbieter des Inhalts, nicht an die Voreinstellung eines Werkzeugs. Wer den Schalter umlegt, übernimmt die Kennzeichnung damit selbst — und sollte einen Prozess dafür haben, statt sich auf ein Symbol zu verlassen, das der Anbieter jederzeit optional stellen kann.

Geopolitik · Apple

Apple hat ein eigenes Modell für China trainiert — mit Alibabas Hilfe und Pekings Genehmigung

Hintergrund & Analyse

Reuters berichtete am 14. August unter Berufung auf mit dem Vorgang vertraute Personen, dass Apple ein eigenes großes Sprachmodell für den chinesischen Markt trainiert hat — gemeinsam mit Alibaba. Sollte sich der Bericht bestätigen, wäre Apple das erste ausländische Unternehmen, dem die chinesischen Behörden den Betrieb eines eigenen, proprietären KI-Modells im Land gestatten. Apple und Alibaba haben sich nicht geäußert.

Der Hintergrund erklärt, warum das eine Meldung ist. Chinesische Regeln verlangen für generative KI-Dienste eine Registrierung und Freigabe bei der Cyberspace-Verwaltung; ausländische Modelle sind faktisch ausgeschlossen. Apple hatte seinen generativen KI-Dienst im Vormonat dort registriert. Bislang lief Apple Intelligence in China über Alibabas Modellfamilie Qwen — das eigene Modell soll nun parallel dazu betrieben werden, nicht an dessen Stelle.

Die Konstruktion ist aufschlussreicher als das Produkt. Apple trainiert selbst, aber nicht allein: Der einheimische Partner liefert offenbar die Voraussetzungen, unter denen die Genehmigung überhaupt möglich wird — von der Datengrundlage über die Infrastruktur bis zur regulatorischen Beziehung. Dasselbe Muster hatte zuvor schon Google für Gemini in China gewählt. Was hier entsteht, ist keine Lokalisierung im Sinne einer Übersetzung, sondern ein separates Produkt mit separater Aufsicht.

Für Produktverantwortliche außerhalb Chinas ist das der eigentliche Lerneffekt, und er ist nicht auf China beschränkt. Wer KI-Funktionen in ein Produkt einbaut, das in mehreren regulierten Märkten ausgeliefert wird, plant zunehmend nicht mehr ein Modell mit regionalen Einstellungen, sondern mehrere Modelle mit getrennten Freigabewegen, getrennten Datenflüssen und getrennten Verantwortlichkeiten. Der Aufwand dafür fällt nicht in der Modellauswahl an, sondern in der Architektur — und wer ihn erst bemerkt, wenn der erste Markt eine eigene Zulassung verlangt, bezahlt ihn doppelt.

Zur Einordnung gehört auch, was hier nicht belegt ist: Größe, Architektur, Trainingsdaten und Zeitplan des Modells nennt der Bericht nicht. Es handelt sich um eine Recherche mit anonymen Quellen, nicht um eine Unternehmensankündigung. Bis Apple oder Alibaba etwas bestätigen, bleibt der Kern der Meldung die regulatorische Neuheit, nicht die technische.

Plattformen · Transparenz

X stellt seinen Ranking-Code unter Apache-Lizenz — samt Schattenbann-Prüfer

Hintergrund & Analyse

X hat am 13. August eine deutlich erweiterte Fassung seines Empfehlungsalgorithmus auf GitHub veröffentlicht — unter Apache-2.0-Lizenz, im Repository xai-org/x-algorithm. Nach übereinstimmenden Berichten ist der Umfang zehn- bis fünfzehnmal größer als bei der Veröffentlichung vom Januar 2026; enthalten sind diesmal Modellkonfigurationen, Filterregeln und Ranking-Parameter. Pull Requests aus der Community sind ausdrücklich vorgesehen.

Die praktisch interessanteste Neuerung ist keine Codezeile, sondern eine Funktion in den Kontoeinstellungen: ein Schattenbann-Prüfer, der als JSON-Datei ausgibt, ob und wie stark die eigenen Beiträge in der Verteilung heruntergestuft werden. Der Pilot ist zunächst auf Konten beschränkt, die mindestens ein Jahr alt sind. Shadowbanning — die stille Reichweitenreduzierung ohne Sperrung oder Benachrichtigung — war jahrelang Gegenstand von Spekulation; erstmals gibt es eine Auskunft dazu vom Betreiber selbst.

Bei aller Transparenz gibt es eine Lücke, die man kennen sollte: Die auf Grok basierende Vorhersage von Regelverstößen ist von der Veröffentlichung ausdrücklich ausgenommen. Das ist ausgerechnet die Komponente, die entscheidet, ob ein Beitrag als problematisch eingestuft und damit heruntergestuft wird. Offen liegt also, wie das Ranking rechnet — nicht, wie das Modell urteilt, das ins Ranking hineinreicht.

Für Unternehmen mit Reichweite auf der Plattform ist das trotzdem mehr als eine Randnotiz. Wer Social-Media-Kennzahlen als Erfolgsmaßstab verwendet, konnte bislang nicht unterscheiden, ob schlechte Zahlen an schlechten Inhalten oder an einer Herabstufung lagen. Diese Unterscheidung ist jetzt zumindest teilweise messbar. Und der veröffentlichte Code ist die erste belastbare Grundlage, um Behauptungen über Reichweitensteuerung zu prüfen, statt sie zu glauben oder zu bestreiten.

Standorte · OpenAI

OpenAI kündigt ein Berliner Büro an — beim Rechenzentrum bleibt es bei der Absicht

Hintergrund & Analyse

In einem am 14. August veröffentlichten Interview mit dem Handelsblatt hat OpenAI-Chef Sam Altman einen zweiten deutschen Standort angekündigt: ein Büro in Berlin, nach dem bestehenden in München. Eröffnungsdatum, Teamgröße und Aufgabenzuschnitt nennt er nicht.

Die Begründung liefert die einzige belastbare Zahl des Interviews: Deutschland sei für OpenAI der größte zahlende ChatGPT-Markt Europas und liege weltweit unter den ersten drei. Das ist ein bemerkenswerter Befund für ein Land, dessen Verhältnis zu amerikanischen Cloud-Diensten üblicherweise als zurückhaltend beschrieben wird — und er passt zu der Beobachtung, dass Zahlungsbereitschaft und öffentliche Skepsis in Deutschland regelmäßig auseinanderfallen.

Beim zweiten Thema des Interviews ist die Lage dünner. Altman bekräftigt, eigene Rechenzentren in Deutschland zu bevorzugen. Nach dem Bericht gibt es bei diesem Projekt allerdings seit Juli keine neuen Entwicklungen: kein Standort, keine Investitionssumme, kein Zeitplan, kein Partner. Damit ist es das, was es im Juli war — eine Absichtserklärung.

Diese Unterscheidung lohnt sich, weil sie im politischen Echo solcher Interviews regelmäßig verschwindet. Ein Büro ist eine Vertriebs- und Personalentscheidung im niedrigen zweistelligen Millionenbereich, oft darunter. Ein Rechenzentrum ist eine Infrastrukturentscheidung, die Netzanschluss, Genehmigungen, Kühlung, Wasser und Stromverträge über Jahre voraussetzt — Themen, bei denen Deutschland langsam ist und bei denen wir zuletzt festgestellt haben, dass nicht einmal der Wasserverbrauch der eigenen Ausbaupläne bekannt ist. Zwischen beiden Ankündigungen liegen zwei Größenordnungen und mehrere Jahre.

Für deutsche Unternehmen ändert das kurzfristig wenig. Wer heute Datenresidenz in Europa braucht, bekommt sie über die bestehenden europäischen Regionen der Hyperscaler oder über Anbieter wie den in dieser Ausgabe behandelten europäischen Weg von Mistral — nicht über ein Rechenzentrum, das noch keinen Standort hat.

Infrastruktur · Inferenz

Elf Leute in Frankreich schreiben GPU-Assembler — und versprechen dreißigfache Inferenz

Hintergrund & Analyse

TechCrunch hat am 14. August ein Porträt des französischen Startups Kog veröffentlicht. Es ist keine Finanzierungsmeldung — die Seed-Runde unter Beteiligung von Varsity VC liegt zurück, ein Betrag wurde nie genannt; zu den Unterstützern zählen der Cloud-Anbieter Scaleway, die Förderbank Bpifrance und das Programm French Tech 2030. Das Unternehmen hat elf Beschäftigte.

Die These ist die interessante Zutat. Der verbreitete Befund lautet, dass Grafikkarten für agentische Arbeitslasten — also für viele kleine, schnell aufeinanderfolgende Modellaufrufe statt weniger großer — schlecht geeignet seien; das ist unter anderem das Verkaufsargument von Spezialanbietern wie Cerebras oder Groq. Kog hält das für ein Missverständnis: Nicht die Hardware sei das Problem, sondern die Softwareschichten darüber.

Der Ansatz ist entsprechend unbequem. Statt auf den üblichen Bibliotheken aufzusetzen, arbeitet Kog nach eigener Darstellung per Reverse Engineering bis auf die Assembler- und Binärcode-Ebene bestehender Rechenzentrums-GPUs — konkret AMDs MI300X und Nvidias H200. Der behauptete Effekt: bis zu dreißigfach schnellere Inferenz gegenüber Standard-Software auf derselben Hardware.

Diese Zahl ist eine Firmenangabe ohne unabhängige Nachmessung, und sie sollte entsprechend gelesen werden. Kog kündigt für September ein erstes großes Modell mit zehnfacher Geschwindigkeit an; eine Series-A-Runde soll danach folgen. Das ist der übliche Ablauf — die Zahl kommt zuerst, der Beleg später, die Finanzierung dazwischen.

Warum die Meldung trotzdem zählt: Wenn die Behauptung auch nur teilweise trägt, verschiebt sie eine Annahme, auf der derzeit erhebliche Investitionen beruhen — nämlich dass Geschwindigkeitsgewinne bei der Inferenz vor allem neue Hardware erfordern. OpenAI hat genau darauf gerade eine eigene Produktkategorie aufgebaut. Für Unternehmen, die eigene Modelle betreiben, lohnt daher weniger die Frage nach dem Faktor als die dahinter: Wie viel Leistung liegt auf den bereits gekauften Karten brach, weil niemand die Softwareschicht darunter angefasst hat?

Reportage

Wenn der Nachweis nichts mehr beweist: Was passiert, wenn Agenten Prüfungen ablegen

Weiterlesen →

Tool-Radar

Neue und trendende KI-Tools des Tages

Hoplite Logo
Verlagert eine lokal eingerichtete Coding-Agenten-Umgebung mit einem Klick in die Cloud — samt Sitzungen, MCP-Servern und Abhängigkeiten.
Das Startup aus dem Y-Combinator-Jahrgang S26 entstand als Nebenprodukt: Die Gründer bauten das Werkzeug ursprünglich intern, um ihre eigenen Cloud-Agenten zu verwalten, und kommerzialisierten es, nachdem ihr Trading-Agent-Projekt gescheitert war. Der praktische Gewinn ist, dass mehrere Agenten parallel laufen, ohne den Laptop lahmzulegen. Launch auf Product Hunt am 14. August.
Coding-Agenten · August 2026
Oasis Logo
Gemeinsamer Arbeitsbereich, in dem Menschen und Agenten wie Claude Code oder Devin als gleichberechtigte Teammitglieder in denselben Räumen arbeiten.
Statt verstreuter Einzelchats laufen alle Unterhaltungen in dauerhaften Räumen zusammen, deren Verlauf neuen Agenten als Kontext dient — das löst genau den Punkt, an dem Agenten-Setups in Teams üblicherweise scheitern: Jeder Agent beginnt bei null, während das Wissen in privaten Chatfenstern verschwindet. Launch auf Product Hunt am 13. August.
Produktivität · August 2026
Suno Studio 2.0 Logo
Macht aus dem browserbasierten KI-Songgenerator eine vollwertige digitale Audio-Workstation mit MIDI-Unterstützung.
Neu sind MIDI-Import und -Aufnahme direkt auf der Zeitleiste, ein Chat-Assistent, der Instrumente, Gesang und eigene Plugins erzeugt, sowie ein Wavetable-Synthesizer und Studio-Effekte bis hin zur Sidechain-Kompression. Damit verschiebt sich Suno vom Generator zum Werkzeug — der Nutzer bearbeitet das Ergebnis, statt neu zu würfeln. Vorerst nur für Premier-Abonnenten. Veröffentlicht am 13. August.
Musikproduktion · August 2026
Cerenovus Logo
Liest Dokumente, E-Mails und Chatverläufe eines Unternehmens und deckt versteckte operative Kosten wie Doppelzahlungen oder verpasste Rabatte auf.
Der Unterschied zu klassischer Ausgabenanalyse liegt in der Quelle: Das System wertet die unstrukturierte Kommunikation aus, in der Verträge, Zusagen und Nachlässe tatsächlich verhandelt werden, und legt belegte Einzelbefunde vor statt eines Dashboards. Von den Harvard-Studenten Lucas Baur, Oliver Moreland und Jonathan Waldorf, Y-Combinator-Jahrgang S26. Launch auf Product Hunt am 11. August.
Business-Analytics · August 2026
isolate.video Logo
Verwandelt rohe Bildschirmaufnahmen automatisch in Produktvideos mit Zoomfahrten, generierter Musik und Spotlight-Effekten.
Kern ist die Funktion „Crop Spotlight“: Man markiert einen Bereich der Oberfläche, den das Werkzeug über die Aufnahme hinweg verfolgt und optisch heraushebt — die mühsamste Handarbeit bei Produktdemos fällt damit weg. Entwickelt vom Einzelentwickler Vignesh Warar aus eigenem Bedarf. Launch auf Product Hunt am 14. August.
Video & Marketing · August 2026
Assembly Studio Logo
Baukasten, der aus einer Beschreibung in normaler Sprache einsatzfähige Anwendungen für Dienstleistungsunternehmen erzeugt — etwa Onboarding-Agenten oder Auswertungsoberflächen.
Interessant ist hier weniger die Prompt-zu-App-Mechanik als der Unterbau: Assembly, früher Copilot, betreibt bereits CRM und Kundenportale für über eine Million Endkunden. Die erzeugten Anwendungen setzen also auf vorhandenen Kundendaten und Rechteverwaltung auf, statt bei einer leeren Datenbank zu beginnen. Launch auf Product Hunt am 12. August.
Business-Anwendungen · August 2026

Aus der Werkstatt

YouTube-Empfehlungen: Tutorials, Erklärungen und Werkzeuge

Grok 4.6, Nemotron 3.5 Lightning, Muse Glimmer, DeepSeek V4 Pro 0813..
Tutorial
Caleb Writes Code · 8:46
Vier neue Modelle in drei Tagen — der Kanal sortiert in knapp neun Minuten, was an den Post-Training-Sprüngen wirklich neu ist und wo bloß Herstellerzahlen neu sortiert wurden. Nützliche Ergänzung zum Leitartikel dieser Ausgabe, weil dieselbe Frage dort für GLM-5.3 offen bleibt. In eigener Sache: Die Videobeschreibung enthält offengelegte Produktwerbung für einen Elektronikhändler; das Thema selbst ist davon nicht betroffen.
The $18 Plan That Matched My $200 Claude Code — GLM-5.3 Day One
Tutorial
Hyperautomation Labs · 9:16
Am Erscheinungstag von GLM-5.3 aufgenommen: fünf reale Programmieraufgaben, einmal über den günstigen Zugang des chinesischen Modells und einmal über ein deutlich teureres Abonnement, jeweils mit Bildschirmaufnahme und der Konfiguration zum Nachbauen. Genau die unabhängige Gegenprobe, die zu den Herstellerzahlen im Leitartikel dieser Ausgabe fehlt — mit der üblichen Einschränkung, dass fünf Aufgaben kein Benchmark sind.