← Zurück zur Ausgabe vom 26. August 2026

Reportage

Wenn der Modellanbieter den Chip baut: Was die Rückkehr der eigenen Hardware für Ihre Rechnung bedeutet

OpenAI legt Messwerte für einen selbst entworfenen Inferenzchip vor, Anthropic baut ein Chipteam auf, Google, Amazon, Microsoft und Meta betreiben ihre eigenen Bausteine längst. Für Unternehmen, die nichts davon selbst bauen, verschiebt das drei Dinge: den Preis, die Vergleichbarkeit und die Frage, wie leicht man den Anbieter noch wechseln kann.

Von Stefan Lange-Hegermann · · 10 Minuten

Die Meldung ist unspektakulär. Die Verschiebung dahinter nicht.

Am Dienstagmorgen hat OpenAI die ersten Messwerte seines eigenen Inferenzchips veröffentlicht. Das ist, für sich genommen, eine Ingenieursmeldung: 1,5- bis 1,9-mal mehr Arbeit je Watt, 1,7- bis 3,6-mal niedrigere Latenz, ausgeliefert wird ab Jahresende in kleinen Stückzahlen. Man kann das lesen und wieder weglegen.

Man kann es aber auch neben drei andere Meldungen legen. Am 5. August bestätigte Anthropic erstmals öffentlich, ein eigenes Chipteam aufzubauen. Meta bereitet die nächste Generation seines internen Beschleunigers für die Fertigung vor. Google, Amazon und Microsoft betreiben ihre eigenen Bausteine seit Jahren — TPU, Trainium, Maia. Und am 24. August berichtete Bloomberg, Nvidia erhöhe die Preise seiner KI-Server um über 15 Prozent.

Vier Meldungen, ein Muster: Die Firmen, bei denen Sie Ihre Token kaufen, bauen zunehmend die Maschinen, auf denen diese Token entstehen. Für Unternehmen, die selbst nie einen Chip entwerfen werden, ist das keine Randnotiz. Es verändert drei Dinge, die in jeder Beschaffungsentscheidung vorkommen: was Sie zahlen, was Sie vergleichen können und wie teuer ein Wechsel wird.

Was ein ASIC ist — und warum das mehr als ein Detail ist

Ein kurzer Umweg, weil davon der Rest abhängt.

Eine Grafikkarte ist ein Allzweckwerkzeug. Sie kann Modelle trainieren, Modelle ausführen, Videos rendern und wissenschaftliche Simulationen rechnen. Diese Flexibilität kostet Fläche auf dem Chip und Strom im Betrieb: Ein erheblicher Teil der Schaltungen liegt bei jeder konkreten Aufgabe brach.

Ein ASIC — ein anwendungsspezifischer Schaltkreis — verzichtet auf diese Flexibilität. Er kann eine Sache, dafür mit weniger Umweg. Bei einem Inferenzchip heißt das: ein fertig trainiertes Modell ausführen, sonst nichts. Kein Training, keine Grafik, keine Simulation. Der Preis dafür ist Starrheit. Ändert sich die Modellarchitektur grundlegend, taugt die Spezialisierung womöglich nicht mehr — und ein Chipzyklus dauert Jahre, ein Architekturzyklus derzeit Monate.

Deswegen war der Bau eigener Chips lange eine Wette, die nur Unternehmen mit gewaltigen, stabilen und gleichförmigen Lasten eingehen konnten. Google hat sie 2015 gewonnen, weil die Suche vorhersagbar war. Dass sie inzwischen auch Modellanbieter eingehen, sagt etwas über deren Lastprofil aus: Es ist offenbar stabil genug geworden, um es in Silizium zu gießen.

Erstens: der Preis — und warum er nicht sofort fällt

Die naheliegende Erwartung lautet: Wenn Anbieter eigene Chips bauen, sinken die Kosten, und irgendwann sinkt der Preis.

Der erste Teil stimmt wahrscheinlich. Der zweite ist eine Annahme.

Die Ersparnis eines eigenen Chips landet zunächst dort, wo sie entsteht — in der Marge des Anbieters. Ob sie weitergegeben wird, hängt vom Wettbewerbsdruck ab, nicht von der Technik. Und dieser Druck ist derzeit ungleichmäßig: Bei einfachen Modellen tobt ein Preiskampf, bei Spitzenmodellen deutlich weniger.

Zugleich läuft die Kostenkurve in die andere Richtung. Nvidia erhöht die Preise um über 15 Prozent, und der Grund liegt nicht im Rechenwerk, sondern im Speicher: TrendForce erwartet für das dritte Quartal 2026 Vertragspreissteigerungen von 13 bis 18 Prozent bei DRAM. Speicher ist knapp, weil alle gleichzeitig bauen.

Für Ihre Planung heißt das: Rechnen Sie nicht mit einer Preissenkung, die aus einer Chipankündigung folgt. Zwischen „unser Chip ist effizienter“ und „Ihre Rechnung wird kleiner“ liegen eine Marge, ein Wettbewerbsumfeld und ein Zeitraum von Jahren. Der Chip, um den es hier geht, geht Ende 2026 in kleinen Stückzahlen in Betrieb und wird 2027 hochgefahren.

Zweitens: die Vergleichbarkeit — hier wird es unangenehm

Das ist der Teil, der in den Schlagzeilen untergeht, und es ist der Teil mit den unmittelbarsten Folgen für Entscheider.

Solange alle auf derselben Hardware rechneten, war ein Modellvergleich eine Modellfrage. Wer heute zwei Anbieter vergleicht, vergleicht ein Bündel: Modell, Chip, Softwareschicht, Systemauslegung. Und die Zahlen, die dazu veröffentlicht werden, stammen fast immer vom Anbieter.

Wie wenig das trägt, lässt sich am aktuellen Beispiel exakt zeigen — nicht weil OpenAI besonders unsauber gearbeitet hätte, sondern weil das Analysehaus SemiAnalysis, das die Messungen im Labor begleitet hat, seine eigenen Einschränkungen ungewöhnlich offen aufgeschrieben hat:

Nichts davon macht die Zahlen falsch. Alles davon macht sie unvergleichbar mit dem, was ein anderer Anbieter nächste Woche veröffentlicht.

Praktische Folge: Wenn in Ihrem Haus Anbieterzahlen in eine Entscheidungsvorlage wandern, gehört neben jede Zahl die Lastannahme — Kontextlänge, Ausgabelänge, Gleichzeitigkeit. Ohne diese drei Angaben ist eine Latenz- oder Durchsatzzahl kein Messwert, sondern eine Marketingaussage. Und die einzige Zahl, die für Sie wirklich zählt, misst ohnehin niemand für Sie: die Ende-zu-Ende-Latenz Ihres eigenen Arbeitsablaufs unter Ihrer eigenen Last. Ein Nachmittag mit Ihren echten Anfragen schlägt jede Herstellergrafik.

Drittens: die Bindung — sie entsteht leiser als erwartet

Die offensichtliche Sorge lautet: Wenn ein Anbieter eigene Chips betreibt, sitze ich fest.

Für die meisten Unternehmen ist diese Sorge in der direkten Form unbegründet. Sie mieten keine Chips, Sie rufen eine API auf. Ob dahinter ein ASIC oder eine Grafikkarte steht, sehen Sie nicht — und genau das ist der Punkt: Die Bindung entsteht nicht über die Hardware, sondern über alles, was Sie um das Modell herum gebaut haben. Prompts, die auf ein bestimmtes Antwortverhalten hin abgestimmt sind. Werkzeugdefinitionen im anbietereigenen Format. Auswertungen, die gegen genau dieses Modell kalibriert wurden. Zwischenspeicher, deren Wirtschaftlichkeit an der Preisstruktur eines Anbieters hängt.

Die eigene Hardware verstärkt das nur indirekt — sie macht es für den Anbieter attraktiver, Eigenheiten zu pflegen, die auf seinem Chip besonders gut laufen und anderswo nicht.

Der handfeste Wechselschutz ist deshalb kein Vertragspassus, sondern eine Architekturentscheidung: eine dünne eigene Abstraktionsschicht zwischen Ihrer Anwendung und dem Anbieter, ein Satz Auswertungen, der gegen mehr als ein Modell läuft, und mindestens ein Zweitanbieter, der einmal im Quartal tatsächlich durchgetestet wird — nicht bloß im Vertrag steht. Das kostet spürbar Aufwand. Der Vergleichsmaßstab ist nicht „wäre schön“, sondern: Was kostet es, wenn Ihr Anbieter den Preis um dreißig Prozent erhöht und Sie sechs Monate brauchen, um zu wechseln?

Die Gegenbewegung: Es wird gerade auch billiger, gar nicht zu mieten

Es wäre eine schiefe Geschichte, wenn hier nur die Konzentration vorkäme. Am selben Tag lief eine zweite Entwicklung, die in die entgegengesetzte Richtung zeigt.

Multiverse Computing hat ein Kompressionsverfahren beschrieben, mit dem ein auf 60 Milliarden Parameter geschrumpftes Modell in 4-Bit-Darstellung sein eigenes 16-Bit-Gegenstück in sieben von neun Tests schlägt — bei rund viermal weniger Speicherbedarf für die Gewichte. IBM hat Granite 4.2 veröffentlicht: drei Reasoning-Modelle mit 3, 8 und 30 Milliarden Parametern unter Apache-2.0-Lizenz, also frei kommerziell nutzbar. Und Apple hat einen Arbeitsplatzrechner vorgestellt, in dem 512 Gigabyte gemeinsamer Speicher bei 1,2 Terabyte pro Sekunde stecken.

Diese drei Meldungen gehören zusammen. Kompression senkt den Speicherbedarf, offene Lizenzen senken die Zugangshürde, und bezahlbarer großer Speicher senkt die Hardwareschwelle. Zusammen verschieben sie die Grenze, ab der es sich lohnt, ein Modell selbst zu betreiben, statt es zu mieten.

Für die meisten Unternehmen wird diese Grenze nicht bei der Kundenanwendung überschritten, sondern bei den unspektakulären Aufgaben im Hintergrund: Klassifizieren, Extrahieren, Zusammenfassen, Umformulieren. Das sind oft Millionen gleichförmiger Aufrufe, für die niemand ein Spitzenmodell braucht — und sie machen in vielen Häusern den größeren Teil der Rechnung aus.

Was Sie in den nächsten Wochen tatsächlich tun können

Vier Dinge, keines davon aufwendig:

Trennen Sie Ihre Last in zwei Klassen. Aufgaben, bei denen die Qualität des besten verfügbaren Modells geschäftsrelevant ist — und Aufgaben, bei denen sie es nicht ist. Der erste Topf bleibt beim Anbieter. Der zweite ist der, bei dem sich die Rechnung gerade ändert.

Erheben Sie Ihre eigene Grundlinie. Latenz und Kosten je Vorgang, gemessen an Ihrem realen Arbeitsablauf, nicht an einer Benchmark. Ohne diese Zahl können Sie kein Angebot bewerten, und ohne sie merken Sie eine schleichende Verschlechterung nicht.

Verlangen Sie Lastannahmen zu jeder Leistungszahl. Kontextlänge, Ausgabelänge, Gleichzeitigkeit. Fehlt eine davon, ist die Zahl nicht vergleichbar — und das gilt für jeden Anbieter gleichermaßen, auch für den, den Sie ohnehin bevorzugen.

Testen Sie den Ausstieg, bevor Sie ihn brauchen. Ein Zweitanbieter, der nur im Vertrag steht, ist kein Zweitanbieter. Einmal im Quartal durchlaufen lassen, Ergebnisse vergleichen, Aufwand dokumentieren. Diese Dokumentation ist Ihre Verhandlungsposition bei der nächsten Preisrunde.

Die eigentliche Nachricht dieser Woche ist nicht, dass ein Chip schneller ist als ein anderer. Sie ist, dass die Schichten des Stapels — Silizium, Modell, Produkt — bei den großen Anbietern wieder zusammenwachsen, so wie es in der Computerindustrie schon einmal war, bevor sie sich in den Neunzigern in spezialisierte Anbieter auftrennte. Integration bringt Effizienz; sie bringt auch Preissetzungsmacht und Intransparenz. Beides kommt im selben Paket, und beides kommt nicht mit einer Ankündigung, sondern über Jahre.

Quellen