← Zurück zur Ausgabe vom 15. September 2026

Reportage

Eine Million Token, und trotzdem vergisst es die Mitte: Warum das beworbene Kontextfenster nicht die nutzbare Kontextlänge ist

Alle großen Anbieter werben inzwischen mit einer Million Token. Ihre eigene Dokumentation räumt ein, dass die Qualität lange vorher nachlässt. Wer darauf ein Produkt baut, sollte den Unterschied zwischen beworbener und effektiver Kontextlänge kennen — und wissen, wie man ihn selbst misst.

Von Stefan Lange-Hegermann · · 9 Minuten

Eine Million Token sind ungefähr 750.000 Wörter. Das ist der gesamte „Herr der Ringe" plus Anhänge, oder ein mittelgroßes Produkthandbuch samt allen Änderungsanträgen der letzten fünf Jahre. Genau damit werben inzwischen alle großen Anbieter, und genau so verkauft es sich intern: Wir müssen die Daten gar nicht mehr aufbereiten, wir werfen einfach alles rein.

Die Rechnung geht nicht auf, und das Bemerkenswerte ist, dass die Anbieter das selbst dokumentieren. Man muss nur an der richtigen Stelle nachlesen.

Was das Kontextfenster eigentlich ist

Zwei Begriffe vorweg, damit der Rest klar wird.

Ein Token ist die Einheit, in der ein Sprachmodell rechnet — im Deutschen grob ein halbes bis ganzes Wort. Das Kontextfenster ist alles, was das Modell bei einer einzelnen Anfrage gleichzeitig vor sich hat: die Systemanweisung, die bisherige Unterhaltung, die angehängten Dokumente und die Antwort, die gerade entsteht. Anthropic beschreibt es in der eigenen Dokumentation treffend als „Arbeitsgedächtnis".

Und dann folgt im selben Absatz der Satz, um den es in dieser Reportage geht: „more context isn't automatically better. As token count grows, accuracy and recall degrade, a phenomenon known as context rot." Das steht nicht in einem kritischen Fachartikel, sondern in der Produktdokumentation des Anbieters, direkt neben der Angabe, dass eine Million Token die Voreinstellung sind.

Der Test, der zu leicht ist

Der Standardnachweis für lange Kontexte heißt „Needle in a Haystack": Man versteckt einen Satz in einem sehr langen Text und fragt danach. Fast alle aktuellen Modelle bestehen das nahezu perfekt — Google nennt in der eigenen Anleitung rund 99 Prozent.

Das Problem ist, dass dieser Test wenig mit dem zu tun hat, was Anwendungen tatsächlich verlangen. Eine Analogie: Es ist der Unterschied zwischen „Finde in diesem Aktenordner die Seite, auf der das Wort Kündigungsfrist steht" und „Lies den Ordner und sag mir, ob sich die Kündigungsfristen in den drei Nachträgen widersprechen". Das Erste ist Suchen. Das Zweite ist Arbeiten.

Zwei Untersuchungen haben genau diese Lücke vermessen.

NoLiMa (ICML 2025) baute den Test so um, dass Frage und gesuchte Stelle möglichst keine wörtliche Überschneidung haben — das Modell muss die Verbindung also erschließen, statt sie zu finden. Getestet wurden 13 Modelle, die alle mindestens 128.000 Token beherrschen. Das Ergebnis: Bei kurzen Eingaben arbeiten sie gut, bei wachsender Länge bricht die Leistung ein. „At 32K, for instance, 11 models drop below 50% of their strong short-length baselines." Bei GPT-4o, einem der besten Modelle im Feld, fiel die Trefferquote von 99,3 auf 69,7 Prozent — bei einem Bruchteil des beworbenen Fensters.

HELMET (ICLR 2025) prüfte 59 Modelle über sieben anwendungsnahe Aufgabenkategorien und kam zu einem Befund, den man Anbieterangaben künftig entgegenhalten sollte: „synthetic tasks like NIAH do not reliably predict downstream performance". Und weiter: Während fast alle Modelle perfekte Needle-Werte erreichen, fallen offene Modelle deutlich zurück, sobald Aufgaben echtes Durchdenken des gesamten Kontexts oder das Befolgen komplexer Anweisungen verlangen — „the gap widens as length increases".

Der dritte Baustein kommt von Chroma, das 18 Modelle — darunter GPT-4.1, Claude 4, Gemini 2.5 und Qwen3 — auf sehr einfache Aufgaben bei wachsender Eingabelänge losließ. Der Kernsatz: Modelle nutzen ihren Kontext nicht gleichmäßig, „their performance grows increasingly unreliable as input length grows". Besonders unangenehm ist ein Nebenbefund: Schon ein einzelner ablenkender, thematisch naher Falschtreffer senkt die Qualität messbar — und geordnete, logisch strukturierte Textsammlungen schnitten schlechter ab als zufällig gemischte. Reale Firmendokumente sind logisch strukturiert.

Warum das passiert

Anthropic benennt die Ursachen im eigenen Technikblog erfreulich unverblümt, und sie sind auch ohne Mathematik verständlich.

Erstens die Architektur. In einem Transformer darf jedes Token auf jedes andere achten. Bei n Token ergibt das Beziehungspaare. Anthropic schreibt: „As its context length increases, a model's ability to capture these pairwise relationships gets stretched thin, creating a natural tension between context size and attention focus." Bildlich: Die Aufmerksamkeit ist ein Budget fester Größe. Verdoppelt man die Textmenge, wird dasselbe Budget auf viermal so viele mögliche Bezüge verteilt.

Zweitens die Trainingsdaten. Modelle lernen überwiegend an kurzen Texten. Für sehr weit auseinanderliegende Bezüge gibt es schlicht weniger Übungsmaterial — die Fähigkeit ist deshalb schwächer ausgebildet als die Fensterangabe vermuten lässt.

Drittens die Positionskodierung. Die Verfahren, mit denen ein Modell überhaupt weiß, an welcher Stelle ein Token steht, lassen sich auf längere Sequenzen strecken. Das ermöglicht große Fenster, verschlechtert aber das Positionsgefühl. Der klassische Nebeneffekt ist seit 2023 als „Lost in the Middle" bekannt: Was am Anfang und am Ende steht, wird zuverlässiger genutzt als das, was in der Mitte liegt.

Was die Anbieter selbst einräumen

Das Ehrlichste steht in der Gemini-Dokumentation. Nach der Feier der 99-Prozent-Werte folgt die Einschränkung: „In cases where you might have multiple ‚needles' or specific pieces of information you are looking for, the model does not perform with the same accuracy. Performance can vary to a wide degree depending on the context."

Genau das ist der typische Unternehmensfall. Niemand sucht eine Zahl in einem Vertrag; man sucht alle Klauseln zu einem Thema über zwölf Dokumente hinweg und will wissen, ob sie zusammenpassen. Für diesen Fall sagt der Anbieter selbst keine verlässliche Qualität zu.

Die Rechnung daneben

Die Kostenseite hat sich 2026 entspannt — und das macht die Qualitätsfrage wichtiger, nicht unwichtiger. Anthropic hält in der Dokumentation fest, dass bei allen Modellen mit Millionen-Fenster diese Größe die Voreinstellung ist: kein Beta-Header, und „long-context requests are billed at standard pricing". Der frühere Aufschlag für lange Anfragen ist weg.

Was bleibt, ist die Latenz. Bevor das erste Wort einer Antwort erscheint, muss das Modell die gesamte Eingabe verarbeiten (das sogenannte Prefill). Bei sehr langen Prompts dominiert dieser Schritt die wahrgenommene Wartezeit. Prompt-Caching hilft erheblich, aber nur, wenn der vordere Teil des Prompts zwischen Anfragen gleich bleibt.

Die Branche arbeitet an dem Problem, und zwar an der Wurzel. DeepSeek beschreibt in der Veröffentlichung zu V4 vom 26. April 2026 eine hybride Aufmerksamkeitsarchitektur, die den Zwischenspeicher zusammenfasst statt ihn vollständig vorzuhalten. Die Zahl aus dem Papier: Bei einer Million Token benötigt die Pro-Variante nur noch 27 Prozent der Rechenoperationen pro Token und 10 Prozent des Zwischenspeichers verglichen mit dem Vorgänger V3.2. Die Begründung der Autoren ist die interessante Stelle — das mache es erst praktikabel, Millionen-Kontexte „routinely" zu nutzen. Man darf das als Eingeständnis lesen, dass es das bis dahin nicht war.

Was das für Agenten bedeutet

Am härtesten trifft die Sache Systeme, die über viele Schritte laufen. Ein Agent sammelt mit jedem Werkzeugaufruf Kontext an: Suchergebnisse, Dateiinhalte, Fehlermeldungen. Das Fenster füllt sich, ohne dass jemand es beabsichtigt hätte.

Anthropic hat dafür Zahlen veröffentlicht, die zu den nützlichsten der ganzen Debatte gehören. In einer Auswertung über 100 Schritte einer Websuche-Aufgabe senkte allein das automatische Entfernen veralteter Werkzeugergebnisse den Tokenverbrauch um 84 Prozent — und verbesserte gleichzeitig die Aufgabenleistung um 29 Prozent. Kombiniert mit einem externen Gedächtnis waren es 39 Prozent gegenüber der Ausgangslage. Der entscheidende Nebensatz: Ohne dieses Aufräumen scheiterten die Abläufe schlicht an der Kontexterschöpfung.

Weniger Kontext lieferte also bessere Ergebnisse. Das ist der Punkt, an dem die Intuition „mehr Fenster gleich mehr Können" endgültig kippt.

Was ein Tech Lead konkret tun sollte

Vier Schritte, alle aus den oben zitierten Arbeiten ableitbar und in wenigen Tagen umsetzbar.

Die eigene effektive Länge bestimmen, statt die beworbene zu glauben. Das RULER-Verfahren von NVIDIA hat dafür eine brauchbare Konvention geprägt: Man definiert eine Qualitätsschwelle und nennt „effektiv" die größte Länge, bei der das Modell sie noch hält. Übertragen heißt das: Testfälle aus echten Produktionsdaten bauen, bei 8K, 16K, 32K, 64K messen, eine Schwelle festlegen — und diese Zahl, nicht die Herstellerangabe, als Produktgrenze ins Design schreiben.

Richtig testen. Keine Einzelfakt-Suche. Die Testfälle müssen mehrere verstreute Informationen verknüpfen, die nicht wörtlich in der Frage vorkommen (das NoLiMa-Prinzip), und sie müssen thematisch nahe Falschinformationen enthalten (das Chroma-Prinzip). Ein Test, den das Modell zu 99 Prozent besteht, misst nichts.

Reihenfolge nutzen. Google empfiehlt in der eigenen Anleitung ausdrücklich, die Frage ans Ende des Prompts zu stellen, nach den Dokumenten. Das kostet nichts und wirkt gegen den Mitte-Effekt.

Bei Agenten das Aufräumen einplanen, bevor es weh tut. Alte Werkzeugergebnisse entfernen, Zwischenstände zusammenfassen und mit frischem Fenster weiterarbeiten, Teilaufgaben an spezialisierte Unteragenten geben, die nur ein verdichtetes Ergebnis zurückliefern statt ihres gesamten Arbeitskontexts.

Die Kurzfassung für die Vorstandssitzung

Das Millionen-Token-Fenster ist real, aber es ist eine Kapazitäts- und keine Qualitätsangabe — ungefähr so, wie die Höchstgeschwindigkeit im Fahrzeugschein nichts darüber sagt, wie schnell man auf einer bestimmten Straße fahren sollte.

Praktisch folgt daraus zweierlei. Erstens: „Wir werfen einfach alles rein und sparen uns die Aufbereitung" ist keine Architektur, sondern eine Wette — und die Anbieterdokumentation selbst sagt, dass sie bei mehreren gesuchten Informationen schlecht steht. Die Vorauswahl, gegen die das große Fenster angeblich immun macht, bleibt die wirksamste Maßnahme.

Zweitens, und das ist die gute Nachricht: Die Frage ist messbar. Ein Team kann in wenigen Tagen die eigene effektive Kontextlänge bestimmen und hat danach eine Zahl, die in Architekturentscheidungen taugt. Das ist deutlich mehr, als die meisten Organisationen heute haben — die meisten haben die Zahl aus der Pressemitteilung.

Quellen