Am 13. August passierten drei Dinge, die auf den ersten Blick nichts miteinander zu tun haben. OpenAI kündigte einen Modus an, in dem sein Spitzenmodell bis zu vierzehnmal schneller antwortet. Der Anbieter Writer stellte ein neues Modell vor — und bewarb dabei nicht dessen Intelligenz, sondern ein Rahmenwerk, das die Tokenkosten eindämmen soll. Und Okta dokumentierte, dass sein MCP-Server Werkzeuge nur noch passend zu den Rechten des Nutzers einblendet, ausdrücklich auch, um Token zu sparen.
Drei Ankündigungen, ein Thema. Die Frage, die 2026 über KI-Produkte entscheidet, ist nicht mehr, welches Modell klüger ist. Sie lautet: Was kostet eine erledigte Aufgabe — und wie lange dauert sie?
Der Preisverfall ist real, und er täuscht
Der Stanford AI Index dokumentiert, dass ein Modell auf GPT-3.5-Niveau im November 2022 noch 20 Dollar pro Million Token kostete. Im Oktober 2024 lag derselbe Leistungspunkt bei 0,07 Dollar — Faktor 280 in weniger als zwei Jahren. Eine Forbes-Analyse vom Juli 2026 auf Basis von EpochAI-Daten kommt auf einen noch steileren Verfall: von 60 Dollar im Jahr 2021 auf rund 6 Cent heute.
Der Druck kommt vor allem aus China. DeepSeeks V4-Flash kostet laut offizieller Preisliste 0,14 Dollar je Million Eingabe-Token und 0,28 Dollar für die Ausgabe, ab dem 16. August außerhalb der Spitzenzeiten die Hälfte davon. Ein westliches Mainstream-Modell wie GPT-4.1 liegt bei 2 beziehungsweise 8 Dollar, Claude Opus 4.8 bei 5 und 25 Dollar.
Wer daraus schließt, dass KI billiger wird, hat die Hälfte der Rechnung.
Warum die Rechnungen trotzdem steigen
Sundar Pichai nannte auf der Google I/O im Mai die Zahl, die das Paradox auflöst: Der Tokenverbrauch bei Google stieg seit 2023 um den Faktor 330 — von 9,7 Billionen Token pro Monat auf über 3,2 Billiarden. Der Stückpreis fällt, die Stückzahl explodiert, und zwar aus drei Gründen, die sich addieren.
Erstens denken Modelle jetzt. Reasoning-Modelle erzeugen vor der sichtbaren Antwort interne Zwischenschritte — sogenannte Denk-Token. Der Kunde sieht sie nicht, bezahlt sie aber zum teureren Ausgabepreis. Praxisbeobachtungen nennen 500 bis 2.000 Denk-Token für eine einfache Frage mit 50 sichtbaren Ausgabe-Token, bei komplexen Aufgaben 5.000 bis 15.000 gegenüber 100 sichtbaren. Das sind Erfahrungswerte, keine kontrollierte Studie — aber die Größenordnung liegt beim Zehn- bis Dreißigfachen des Sichtbaren.
Zweitens laufen Agenten in Schleifen. Ein Agent plant, ruft ein Werkzeug auf, betrachtet das Ergebnis, korrigiert, versucht es erneut. Jeder dieser Schritte ist ein eigener Modellaufruf, und jeder trägt den gesamten bisherigen Gesprächsverlauf als Eingabe mit sich. Die Kosten wachsen deshalb nicht linear mit der Zahl der Schritte, sondern schneller. (Eine viel zitierte Zahl von McKinsey, agentische Abläufe verbrauchten bis zu tausendmal mehr Token, ließ sich auf keine Primärquelle zurückführen — wir führen sie deshalb nicht.)
Drittens wächst der Kontext. Ein Fenster von einer Million Token ist 2026 Standard. Wer es füllt, zahlt es.
Wie sehr das ins Gewicht fällt, zeigen die Ausgabenzahlen. Menlo Ventures erhob unter 495 US-Entscheidern, dass Unternehmensausgaben für generative KI 2025 auf 37 Milliarden Dollar stiegen — von 11,5 Milliarden im Jahr davor. Gartner erwartet für 2026 weltweite KI-Ausgaben von 2,59 Billionen Dollar und hat diese Prognose im Mai bereits nach oben korrigiert.
Latenz ist bei Agenten kein Komfortmerkmal
Bei einer Chatoberfläche entscheidet Geschwindigkeit über Behaglichkeit. Bei Agenten entscheidet sie über Machbarkeit, weil die Schritte nacheinander laufen: Bei zwanzig sequenziellen Modellaufrufen multipliziert sich jede Sekunde Wartezeit mit zwanzig. Ein Ablauf, der bei drei Sekunden pro Schritt eine Minute dauert, dauert bei zwanzig Sekunden fast sieben. Aus einem Werkzeug, das man beim Arbeiten benutzt, wird eines, das man abends anstößt und morgens ausliest.
Genau hier setzt der Wettbewerb der Spezialhardware an. OpenAIs Ultrafast erreicht auf Cerebras-Chips bis zu 750 Ausgabe-Token pro Sekunde. Groq liefert mit seiner LPU-Architektur gleichbleibend niedrige Latenz statt Spitzendurchsatz, SambaNova optimiert auf Gesamtdurchsatz bei vielen parallelen Nutzern. Wofür ein Chip optimiert, sollte die Auswahl bestimmen: Ein interaktiver Assistent braucht kurze Zeit bis zum ersten Zeichen, ein nächtlicher Stapelverarbeiter braucht Durchsatz — und es sind nicht dieselben Chips.
Bezeichnend ist ein Wert aus Cerebras' eigenen Messungen: Auf dem Benchmark GDP-Val bringt Ultrafast einen 5,6-fachen Beschleunigungsfaktor über den gesamten Arbeitsablauf — nicht den vierzehnfachen aus der Überschrift. In echten Abläufen wartet ein Agent auch auf Datenbanken, Netzwerk und Dateisysteme. Wer Latenzgewinne einkauft, sollte deshalb zuerst messen, welcher Anteil der Gesamtzeit überhaupt auf das Modell entfällt. Häufig ist es weniger, als man denkt.
Die Hebel, die tatsächlich wirken
Vier Ansätze sind mit belastbaren Zahlen unterlegt.
Prompt-Caching speichert wiederkehrende Teile eines Prompts serverseitig zwischen — den Systemprompt, die Werkzeugdefinitionen, das große Referenzdokument —, sodass sie nicht bei jeder Anfrage neu bezahlt werden müssen. Anthropic dokumentiert das präzise: Ein Lesezugriff kostet 10 Prozent des Eingabepreises, also 90 Prozent Rabatt; das Schreiben kostet einmalig das 1,25-Fache (fünf Minuten Haltedauer) oder das Doppelte (eine Stunde). Bei Opus fällt der Eingabepreis damit von 5 auf 0,50 Dollar je Million Token. Die Rechnung lohnt sich ab der zweiten Anfrage mit demselben Präfix — bei einem Chatverlauf also praktisch immer. Kein Zufall, dass Google bei Gemini 3.7 Flash eine höhere Cache-Trefferquote als Verkaufsargument nennt.
Batch-Verarbeitung bringt rund 50 Prozent Rabatt, wenn Antworten nicht sofort gebraucht werden — Klassifizierung, Anreicherung, Auswertung über Nacht.
Modell-Routing und Kaskaden schicken eine Anfrage zuerst an ein günstiges Modell und eskalieren nur bei Unsicherheit an ein teures. Praxisberichte nennen Einsparungen zwischen 50 und 98 Prozent; ein typischer Router in einem Unternehmens-Arbeitsablauf spart im Mittel rund 38 Prozent, mit einer Bandbreite von 25 bis 55 Prozent.
Kontextdisziplin. Der unspektakulärste Hebel ist der, den Okta demonstriert: Der MCP-Server blendet einem Agenten nur die Werkzeuge ein, für die der Nutzer berechtigt ist. Das ist zunächst eine Sicherheitsmaßnahme nach dem Prinzip der geringsten Rechte — spart aber nebenbei Kontext, weil Werkzeugdefinitionen bei jeder Anfrage mitgesendet werden. Die kursierende Zahl von bis zu 96 Prozent weniger Kontextverbrauch stammt aus Oktas Marketing, nicht aus den Release Notes.
Writer macht genau diesen Gedanken zum Produktmerkmal: Das überarbeitete Rahmenwerk senke die Kosten im Schnitt um 40 Prozent bei 44 Prozent schnellerer Erledigung — und zwar über alle getesteten Modelle hinweg, auch über fremde. Das ist eine Studie des Anbieters selbst, ohne unabhängige Prüfung. Interessant ist trotzdem, dass ein Modellanbieter so argumentiert: Er verkauft nicht mehr das Modell, sondern die Sparsamkeit im Umgang damit.
Die Kennzahl, die Sie brauchen
Kosten pro Token ist die falsche Kennzahl: Sie misst einen Einsatzfaktor, nicht ein Ergebnis. Die Kennzahl, die sich 2026 durchsetzt, ist Kosten pro gelöster Aufgabe. Marktbeobachtungen für Coding-Agenten nennen 0,03 bis 0,13 Dollar pro Aufgabe bei günstigen Arbeitspferd-Modellen gegenüber 4,10 bis 4,82 Dollar bei Frontier-Modellen — ein Verhältnis von rund 1 zu 40, bei Qualitätsunterschieden, die meist deutlich kleiner ausfallen.
Im Kundenservice ist die Größenordnung greifbarer, weil dort bereits pro Ergebnis abgerechnet wird: Anbieter verlangen zwischen 0,40 und 3,50 Dollar pro gelöstem Ticket. Ein Händler mit tausend Tickets im Monat zahlt so rund 790 Dollar; in der Hochsaison bei viertausend Tickets sind es rund 3.170 Dollar. Diese Zahlen kann man einem Aufsichtsrat vorlegen. Token-Statistiken nicht.
Der praktische Rat lautet deshalb: Definieren Sie für jeden Anwendungsfall die Einheit, die zählt — ein beantwortetes Ticket, ein zusammengeführter Pull Request — und messen Sie deren volle Kosten inklusive fehlgeschlagener Versuche.
Die Gegenposition, die man ernst nehmen sollte
Es gibt ein Argument gegen diesen ganzen Aufwand, und es ist besser, als es zunächst klingt. Scott Breitenother, Mitgründer und Geschäftsführer von Kilo Code, formuliert es so: „Den Zugang zu deckeln, um eine Budgetzeile zu schützen, heißt, die falsche Variable zu optimieren." Wer einem Ingenieur ohnehin 25.000 Dollar im Monat zahlt, solle sich über 2.000 bis 3.000 Dollar Tokenkosten nicht den Kopf zerbrechen — die Frage sei nicht, wie viel man für Token ausgibt, sondern was man ausliefert.
Dahinter steht das Jevons-Paradoxon: Wird eine Ressource effizienter nutzbar, sinkt ihr Verbrauch nicht — er steigt, weil Anwendungen wirtschaftlich werden, die vorher zu teuer waren. James Watts effizientere Dampfmaschine senkte den Kohleverbrauch nicht, sie vervielfachte ihn.
Beide Positionen lassen sich versöhnen, wenn man sie auf unterschiedliche Fälle anwendet. Bei einem internen Werkzeug für zwanzig Entwickler ist Kostenoptimierung verschwendete Zeit — die Tokenrechnung verschwindet neben den Personalkosten. Bei einem Produktmerkmal für eine Million Endkunden ist sie die Marge. Der Unterschied ist nicht die Technik, sondern ob die Kosten mit der Nutzung skalieren.
Was daraus folgt
Drei Dinge sind an der Entwicklung dieses Jahres neu, und alle drei betreffen Entscheidungen, nicht Technik.
Erstens ist Geschwindigkeit vom Nebenprodukt zum eigenen Produkt geworden. Bislang hieß Echtzeitgeschwindigkeit, ein kleineres Modell zu wählen. Wenn diese Kopplung fällt, wird Latenz separat bepreisbar — und OpenAI nennt für Ultrafast bezeichnenderweise noch keinen Preis.
Zweitens ist die Modellauswahl eine laufende Betriebsentscheidung geworden, keine Architekturentscheidung mehr. Wenn Anbieter ihr Arbeitspferd im Dreiwochentakt ersetzen und Preise halbieren, muss der Wechsel Tage kosten, nicht Wochen. Das setzt automatisierte Auswertungen voraus — eine Sammlung echter Aufgaben mit erwarteten Ergebnissen, gegen die sich ein neues Modell in einem Durchlauf prüfen lässt. Wer die nicht hat, kann Preissenkungen nicht einlösen.
Drittens wandert der Engpass. Er lag beim Training, dann bei den Chips, dann beim Strom. 2026 liegt er in der Frage, wie viele Token eine Aufgabe verbraucht, bis sie erledigt ist. Das ist keine Frage an den Modellanbieter, sondern an die eigene Architektur.
- Stanford HAI — AI Index Report 2025, Kapitel 1 (Inferenzkosten)
- TechCrunch — OpenAI introduces Ultrafast mode for GPT-5.6 Sol
- Cerebras — Accelerating GPT-5.6 Sol Ultrafast with OpenAI
- TechCrunch — Writer introduces new AI model and upgraded harness to contain token costs
- Anthropic — Dokumentation zum Prompt-Caching
- DeepSeek — offizielle API-Preisseite
- Okta Developer — Release Notes zum Open-Source-MCP-Server
- Menlo Ventures — The State of Generative AI in the Enterprise
- Forbes — As Token Costs Plunge, Enterprise AI Providers Face A New Margin Squeeze
- Forbes Technology Council — AI Pricing: Why Cost Optimization Is The Wrong Battle
- eesel AI — How much does an AI support agent cost?