Hardware · Eigene Chips
OpenAI legt die ersten Messwerte seines eigenen Chips vor — und der Analyst, der dabei war, sagt selbst, dass der Vergleich unfair ist
Vorbemerkung zur Quellenlage: Sämtliche Leistungsangaben stammen von OpenAI. Das Analysehaus SemiAnalysis war bei den Messungen im Labor anwesend, schreibt aber wörtlich: „All numbers are provided to us by OpenAI. We verified the InferenceX runs in person in the lab, but we did not run the full suite“ — und es lagen ihm keine Ergebnisse der Testreihe vor, die es selbst für aussagekräftiger hält. Die Primärquelle openai.com beantwortet Anfragen auch mit Browser-Kennung mit HTTP 403 und ist deshalb unten nicht gelistet; wir stützen uns auf die Berichte dreier Häuser, die bei der Pressevorführung dabei waren.
Was passiert ist. Am Dienstagmorgen um 07:00 Uhr UTC veröffentlichte OpenAI die ersten Messwerte zu Jalapeño, seinem eigenen Inferenzchip. Fünf Minuten später, um 07:05 Uhr, erschien ein zweiter Beitrag — verfasst von Finanzchefin Sarah Friar, überschrieben mit „The full stack behind abundant intelligence“. Zwei Beiträge, fünf Minuten Abstand: Das ist keine Zufallslage, sondern eine abgestimmte Doppelbotschaft. Der eine liefert die Technik, der andere die Begründung, warum ein Modellanbieter überhaupt Chips baut.
Die Zahlen. Gemessen wurde mit InferenceX, einer Testreihe des Analysehauses SemiAnalysis. Über drei Modelle hinweg — GPT-OSS 120B, DeepSeek R1 und Kimi K2.5 1T — gibt OpenAI an, Jalapeño leiste das 1,5- bis 1,9-fache an KI-Arbeit je Watt bei Spitzendurchsatz und komme auf eine 1,7- bis 3,6-mal niedrigere Ende-zu-Ende-Latenz. Bei stark interaktiven Lasten nennt das Unternehmen den Faktor 2,1 bis 4,1. Verglichen wird gegen die zum Messzeitpunkt besten dokumentierten Werte, und die stammten von Nvidias GB200 beziehungsweise GB300.
Was der Chip ist. Jalapeño ist ein anwendungsspezifischer Schaltkreis (ASIC), gemeinsam mit Broadcom entwickelt und im Juni erstmals öffentlich gezeigt. Anders als eine Grafikkarte kann er nur eines, dafür gut: ein bereits trainiertes Modell ausführen. Nach den von SemiAnalysis genannten Eckdaten sitzt in der aktuellen Ausbaustufe ein einzelner, reticle-großer Chip in TSMCs N3P-Fertigung mit 13,4 PFLOPs in MXFP4, dazu HBM4-Speicher mit 15,4 TB/s. Die Leistungsaufnahme liegt bei 700 Watt — Nvidias kommende Rubin-Generation wird dort mit 900 bis 1.150 Watt geführt. Ein Rack fasst 128 dieser Chips, ein Verbund skaliert auf 2.048 Chips über 16 Racks bei rund 160 Kilowatt.
Und jetzt die Einschränkungen — sie kommen vom Prüfer selbst. SemiAnalysis schreibt, der Vergleich mit Blackwell sei „somewhat incomplete and unfair“, denn Jalapeño trete in Wahrheit gegen Chips wie Rubin an. Gemessen wurde außerdem nur mit 8.000 Token Kontext und 1.000 Token Ausgabe — eine Last, die das Haus als „a much easier workload to tune for“ bezeichnet. Die getesteten Modelle seien nicht die aktuelle offene Spitze; je größer und neuer ein Modell, desto aufwendiger sei die Inbetriebnahme auf neuer Hardware. Und die Ergebnisse der Testreihe AgentX, die SemiAnalysis wegen langer Kontexte und mehrstufiger Dialoge für den realistischeren Maßstab hält, lagen schlicht nicht vor.
Ein Detail, das gern übersehen wird. Nach der Darstellung von SemiAnalysis lief Jalapeño in den Vergleichsdiagrammen ohne Multi-Token-Prediction, während die Konkurrenzchips jeweils in ihrer bestmöglichen Konfiguration antraten. Wer die Balken nebeneinanderlegt, vergleicht also nicht identisch eingestellte Systeme.
Was OpenAI selbst nicht behauptet. Hardware-Vizepräsident Richard Ho beschrieb den Chip in der Pressevorführung als „best of both worlds“ — niedrigere Latenz und höherer Durchsatz zugleich, wo man sonst zwischen beidem wählen müsse. Zugleich sagte er ausdrücklich, OpenAI erwarte nicht, seine gesamte Chipflotte durch Jalapeño zu ersetzen; zur Rechenstrategie gehörten weiterhin „very good partners“ wie Nvidia. Ausgeliefert wird in kleinen Stückzahlen bis Jahresende, hochgefahren wird 2027. Wie viele Chips es werden sollen, sagt das Unternehmen nicht. Eine zweite und dritte Generation sind in Arbeit.
Warum das eine Beschaffungsnachricht ist. Am Montag hat Nvidia auf der Hot Chips sechs Ankündigungen gleichzeitig freigegeben und laut Bloomberg-Bericht die Preise seiner KI-Server um über 15 Prozent erhöht — wir haben das gestern beschrieben. Einen Tag später legt einer der größten Abnehmer dieser Server Messwerte vor, die zeigen sollen, dass er dieselbe Arbeit mit weniger Strom erledigen kann. Das ist Verhandlungsposition, nicht nur Ingenieurskunst.
Und OpenAI ist damit nicht allein. Anthropic hat am 5. August erstmals öffentlich bestätigt, ein eigenes Chipteam aufzubauen; Meta bereitet die nächste Generation seines internen Beschleunigers vor; Google, Amazon und Microsoft betreiben ihre eigenen Bausteine seit Jahren. Was das für Unternehmen bedeutet, die nichts davon selbst bauen — für Preise, Portabilität und die Frage, ob man Anbieterangaben überhaupt noch vergleichen kann —, führen wir in der Reportage dieser Ausgabe aus.
- The Verge — OpenAI says its Jalapeño chip can power faster AI responses than the competition (Emma Roth, 25.8.2026)
- TechCrunch — OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show (Russell Brandom, 25.8.2026)
- SemiAnalysis — OpenAI Jalapeño: Better Than Nvidia Blackwell (25.8.2026)
- TechCrunch — Anthropic is hiring an AI chip design team (5.8.2026)