Dass Nvidia am Montag 3,5 Milliarden Dollar in den taiwanischen Chipdesigner MediaTek gesteckt hat, ist die Nachricht. Der Grund dahinter ist die eigentliche Geschichte — und sie betrifft jedes Unternehmen, das KI-Funktionen in ein Produkt einbaut, auch wenn es nie einen Chip kaufen wird.
Ein Taschenmesser und ein Spezialwerkzeug
Zwei Begriffe muss man auseinanderhalten. Eine GPU ist ein Schweizer Taschenmesser. Sie ist frei programmierbar und kann fast jede Rechenaufgabe übernehmen: Grafik, wissenschaftliche Simulation, das Training beliebiger KI-Architekturen. Diese Flexibilität kostet Chipfläche und Strom, denn ein Großteil des Siliziums ist für Aufgaben da, die man gerade nicht braucht.
Ein ASIC — ein anwendungsspezifischer Schaltkreis — ist das maßgeschneiderte Werkzeug daneben. Er verdrahtet eine bestimmte Rechenoperation direkt in Silizium und lässt alles weg, was diese eine Aufgabe nicht braucht. Das Ergebnis ist deutlich sparsamer im Stromverbrauch und günstiger pro Recheneinheit. Der Preis: Er kann sich nicht auf grundlegend neue Architekturen umstellen. Ist er gefertigt, ist er festgelegt.
Daraus folgt eine klare wirtschaftliche Bedingung. Ein eigener Chip lohnt sich nur, wenn ein sehr hohes, stabiles Rechenvolumen mit einer bekannten, sich nicht mehr grundlegend ändernden Architektur anfällt. Der Musterfall ist Inferenz — das Ausführen eines fertig trainierten Modells — bei einem milliardenfach genutzten Dienst. Beim Training neuer, experimenteller Architekturen dagegen, wo sich die Rechenoperationen von Generation zu Generation verändern, bleibt die Flexibilität der GPU meist überlegen.
Genau diese Trennlinie zieht sich durch alle aktuellen Ankündigungen: Selbst OpenAI hat seinen eigenen Chip ausdrücklich nur für Inferenz vorgesehen. Das Vortraining bleibt vorerst auf Nvidia-Hardware.
Wer inzwischen eigenes Silizium baut
Die Liste ist in den vergangenen achtzehn Monaten von einer Kuriosität zur Norm geworden.
Google ist am weitesten. Die siebte TPU-Generation Ironwood erreichte 2026 volle Verfügbarkeit; ein Verbund koppelt 9.216 Chips zu über 40 Exaflops. Wie ernst es gemeint ist, zeigte sich schon im Oktober 2025, als Anthropic sich in einem Vertrag im zweistelligen Milliardenbereich Zugriff auf bis zu eine Million TPUs und mehr als ein Gigawatt Kapazität sicherte.
Amazon fährt dieselbe Strategie mit demselben Ankerkunden. Im April 2026 vertieften beide Seiten ihre Bindung: fünf Milliarden Dollar frisches Eigenkapital, bis zu zwanzig Milliarden an Meilensteinzahlungen — und im Gegenzug verpflichtet sich Anthropic zu hundert Milliarden Dollar AWS-Ausgaben über zehn Jahre, bei einem Kapazitätsziel von fünf Gigawatt.
Meta und Microsoft bauen dagegen rein interne Effizienzchips. Metas MTIA-Reihe wurde im März 2026 in vier Generationen angekündigt, Microsofts Maia 200 läuft seit Januar 2026 im eigenen Rechenzentrum. Beide tauchen in keinem Cloud-Katalog auf. Für Kunden sind sie schlicht nicht buchbar — sie senken die Kosten des Anbieters, nicht Ihre.
OpenAI stieg im Juni 2026 mit dem gemeinsam mit Broadcom entwickelten Inferenzchip Jalapeño ein, vom Design bis zum Tape-out in neun Monaten. Anthropic bestätigte im August 2026 ein eigenes Chip-Design-Team; ein Fertigungspartner ist berichtet, aber nicht offiziell bestätigt — behandeln Sie das als Gerücht.
Wer daran verdient, lässt sich an den Zahlen der Auftragsdesigner ablesen. Broadcom steigerte seinen KI-Halbleiterumsatz im Quartal bis Anfang Mai 2026 um 143 Prozent auf 10,8 Milliarden Dollar und erwartet für die zweite Jahreshälfte 2026 noch einmal etwa eine Verdopplung; der Auftragsbestand liegt nach Unternehmensangaben deutlich über dem bereits Ausgelieferten. Vier der sechs großen Custom-Chip-Kunden sind namentlich bekannt: Anthropic, Google, Meta, OpenAI. Marvell meldete Ende August einen Rekordumsatz von 2,74 Milliarden Dollar, davon 79 Prozent aus dem Rechenzentrumsgeschäft.
Dass Nvidia deshalb in Bedrängnis wäre, lässt sich allerdings nicht behaupten: Der Konzern meldete für sein im Juli 2026 endendes Quartal 89 Milliarden Dollar Rechenzentrumsumsatz bei 75 Prozent Bruttomarge. Die ASIC-Anbieter wachsen schneller — aus einer sehr viel kleineren Basis.
Warum Ihre Token billiger geworden sind
Der für Sie sichtbare Effekt ist der Preisverfall bei Inferenz. Eine Million Eingabe-Token kostete bei GPT-4s API-Start im März 2023 dreißig Dollar. Vergleichbar leistungsfähige Modelle der Economy-Klasse liegen heute bei rund zehn Cent — ein Rückgang um über 99 Prozent in gut drei Jahren.
Dieser Verfall geht nicht allein auf ASICs zurück; Modelloptimierung, Quantisierung und schlichter Wettbewerbsdruck tragen mindestens ebenso viel bei. Aber die Verfügbarkeit spezialisierter, sparsamer Inferenz-Hardware ist ein struktureller Treiber, und sie wirkt weiter. Das Analysehaus New Street Research prognostiziert, Nvidias Anteil an der reinen Inferenzrechenleistung könne von über 90 auf 20 bis 30 Prozent bis 2028 fallen. Das ist eine Prognose, keine Tatsache — aber sie beschreibt die Richtung, in die alle Beteiligten investieren.
Für ein Softwareunternehmen heißt das konkret: Die Grenzkosten jedes KI-Features im eigenen Produkt sinken weiter. Kalkulationen, die vor achtzehn Monaten gegen eine Funktion sprachen, sollten neu aufgemacht werden.
Der Preis der Ersparnis
Die zweite Spalte der Rechnung steht in keinem Preisblatt. Die günstigsten Angebote sind an bestimmte Infrastruktur gebunden — und zwar fester, als es bei generischer GPU-Kapazität der Fall war.
TPUs sind praktisch ausschließlich über Google Cloud nutzbar, Trainium ausschließlich über AWS. Eine Nvidia-GPU bekommen Sie bei jedem Anbieter, und sie verhält sich überall gleich. Wer sich auf ein günstigeres, hauseigenes Backend einlässt, bindet sich enger an genau einen Cloud-Anbieter.
Auf der Softwareebene verschärft sich das. Nvidias CUDA ist über Anbieter hinweg portabel; TPUs verlangen den Umweg über Googles XLA-Compilerschicht beziehungsweise JAX- und PyTorch-Backends, AWS-Chips das hauseigene Neuron-SDK. Für den typischen Fall — ein Unternehmen ruft ein Modell über eine API auf — ist das zunächst unsichtbar, weil der Anbieter die Übersetzung übernimmt. Sichtbar wird es in dem Moment, in dem Sie eigene Modelle betreiben, feinabstimmen oder den Anbieter wechseln wollen. Dann ist der Aufwand nicht mehr eine Konfigurationsänderung, sondern ein Projekt.
Nvidias eigene Antwort auf die Bewegung ist bezeichnend unaggressiv: Mit NVLink Fusion öffnet der Konzern seit 2026 seine bislang proprietäre Verbindungstechnik für fremde Beschleuniger — Partner sind unter anderem MediaTek, Marvell, Alchip, Astera Labs, Synopsys und Cadence. Die Logik: Selbst wenn ein Cloud-Anbieter einen Teil seiner Rechenlast auf eigene Chips verlagert, bleibt Nvidias Netzwerktechnik das Rückgrat der Anlage.
Die Gegenrede
Es gibt gute Gründe, die Verdrängungserzählung zu bezweifeln. Ein Custom-Chip lohnt sich nur bei einer sehr engen Kombination von Bedingungen, und die mehrjährigen, milliardenschweren Entwicklungskosten können sich ohnehin nur eine Handvoll Konzerne leisten — praktisch genau jene, die schon heute Nvidias größte Kunden sind.
Hinzu kommt das Auslastungsrisiko. Ein Chip, der auf eine Modellgeneration zugeschnitten ist, kann bei einem unerwarteten Architektursprung über Nacht an Wert verlieren, während sich eine GPU-Flotte softwareseitig umrüsten lässt. Und Nvidias Ökosystem — nach eigenen Angaben über fünf Millionen aktive Entwickler und zwei Jahrzehnte optimierter Bibliotheken — lässt sich nicht kurzfristig kopieren. Allerdings räumen auch Branchenbeobachter ein, dass dieses Argument bei standardisierten Inferenz-Workloads erheblich an Gewicht verliert. Genau dort setzt die aktuelle Welle an.
Ein methodischer Hinweis, der über diesen Text hinaus gilt: Sämtliche Effizienzvergleiche in dieser Debatte — Googles doppelte Leistung pro Watt gegenüber der Vorgängergeneration ebenso wie Nvidias Vergleichszahlen — stammen von den Herstellern selbst. Unabhängige Messungen mit vergleichbarer Basis gibt es kaum.
Drei Fragen für die nächste Anbieterrunde
Wie stabil ist unsere Modellwahl? Wer regelmäßig zwischen Foundation-Modellen wechselt oder eigene, sich schnell verändernde Modelle trainiert, profitiert kaum von ASIC-getriebenen Rabatten — die hängen an einer bestimmten Architektur und einem bestimmten Anbieter.
Was kostet der Rückweg? Bevor Sie ein Angebot annehmen, das auf hauseigener Infrastruktur beruht, fragen Sie ausdrücklich nach: Zu welchen Konditionen wäre ein Wechsel zurück auf generische Kapazität möglich, welche Anpassungen erfordert das, und wie lange dauert es? Ein Anbieter, der darauf keine belastbare Antwort gibt, hat die Frage beantwortet.
Woher stammt die Effizienzzahl? Bei jeder Angabe wie „halb so teuer“ oder „doppelte Leistung pro Watt“ lohnt die Nachfrage, ob es sich um eine unabhängige Messung handelt oder um einen Vergleich mit dem eigenen Vorgängerprodukt.
Wer diese drei Fragen beantworten kann, erkennt, ob die ASIC-Welle dem eigenen Unternehmen tatsächlich niedrigere Kosten bringt — oder nur eine neue, unauffälligere Form der Anbieterbindung.
- NVIDIA — Financial results for Q2 fiscal 2027
- Futurum Group — Broadcom Q2 FY 2026: AI-led semiconductor expansion
- Marvell — Q2 fiscal year 2027 financial results
- Google Blog — Ironwood: The first Google TPU for the age of inference
- CNBC — Google and Anthropic announce cloud deal worth tens of billions
- Anthropic — Anthropic and Amazon expand collaboration for up to 5 gigawatts
- TechCrunch — OpenAI unveils its first custom chip, built by Broadcom
- Tom's Hardware — Meta's MTIA chip lineup joins hyperscaler push
- Tom's Hardware — Anthropic to build its own co-designed custom AI accelerator
- NVIDIA Developer Blog — Integrating custom compute with NVLink Fusion