← Zurück zur Ausgabe vom 1. August 2026

Reportage

Alle bauen einen Router — einer hat ihn wieder abgeschafft: Was LLM-Gateways wirklich leisten

Zwischen Anwendung und Modell hat sich eine neue Software-Schicht eingenistet: das LLM-Gateway. OpenRouter leitet damit 25 Billionen Token pro Woche durch und ist 1,3 Milliarden Dollar wert. Doch das meistversprochene Feature dieser Schicht — automatisch das billigste passende Modell wählen — funktioniert schlechter, als die Verkaufsprospekte nahelegen. Eine Firma hat ihren Router nach vier Monaten wieder abgeschaltet und öffentlich erklärt, warum.

Von Stefan Lange-Hegermann · · 8 Minuten

Zwischen der eigenen Anwendung und dem Sprachmodell, das sie antreibt, hat sich in den vergangenen zwei Jahren eine neue Software-Schicht eingenistet. Sie heißt LLM-Gateway, manchmal auch Model-Router, und die einfachste Beschreibung ihrer Funktion ist die eines Spediteurs: Man übergibt ihr ein Paket, und sie entscheidet, welcher Frachtführer es transportiert — heute OpenAI, morgen Anthropic, bei einfacher Ware vielleicht ein billigerer Anbieter.

Der Vergleich trägt weiter, als er zunächst wirkt. Ein Spediteur nimmt einem die Verträge mit einem Dutzend Transportfirmen ab, verhandelt Preise, springt ein, wenn ein Fahrer ausfällt, und sagt am Monatsende, was welche Sendung gekostet hat. Genau das leistet ein LLM-Gateway: eine einheitliche Schnittstelle statt eines halben Dutzends Anbieter-APIs, automatisches Ausweichen bei Ausfällen, Ratenbegrenzung, Zwischenspeicherung, getrennte Schlüssel und Budgets pro Team, Protokollierung, Kostenauswertung und Inhaltsfilter.

Und dann gibt es noch die Funktion, mit der diese Schicht am liebsten verkauft wird: das semantische Routing. Die Idee klingt bestechend — eine kleine, schnelle Komponente schätzt ab, wie schwierig eine Anfrage ist, und schickt Einfaches an ein günstiges, Schweres an ein teures Modell. Wer zwei Drittel seiner Anfragen von einem Fünf-Dollar- auf ein Zwanzig-Cent-Modell umlenkt, spart erheblich. Genau an dieser Funktion aber scheiden sich seit Ende Juli die Geister.

Ein Markt, in dem die Marge schon verschwunden ist

Wirtschaftlich ist die Schicht längst Realität. OpenRouter, der mit Abstand größte Anbieter, leitet nach eigenen Angaben rund 25 Billionen Token pro Woche durch — eine Verfünffachung binnen sechs Monaten — bedient über acht Millionen Nutzer und schloss im April 2026 eine Series B über 113 Millionen Dollar unter Führung von CapitalG ab, bei einer Bewertung um 1,3 Milliarden Dollar. Der annualisierte Umsatz stieg von rund 19 Millionen Dollar Ende 2025 auf etwa 50 Millionen im März 2026.

Daneben steht ein dicht besetztes Feld. LiteLLM ist die quelloffene, selbst betriebene Variante und dominiert überall dort, wo Daten das eigene Rechenzentrum nicht verlassen dürfen. Portkey und Helicone verkaufen gemanagte Dienste mit Schwerpunkt auf Auswertung und Nachvollziehbarkeit. Kong bedient Unternehmen, die ohnehin schon sein API-Management einsetzen; Cloudflares AI Gateway ist im Kern gratis, weil Cloudflare am umgebenden Ökosystem verdient. Requesty positioniert sich mit einem Standort in Frankfurt und ausdrücklicher Nulldatenspeicherung explizit über die europäische Rechtslage.

Bemerkenswert ist, was mit den Preisen passiert ist: Nach übereinstimmenden Marktvergleichen aus 2026 haben praktisch alle großen Gateways ihren Aufschlag auf die durchgeleiteten Token auf null gesenkt. Wer heute in diesen Markt einsteigt, verkauft nicht mehr Vermittlung, sondern Kontrolle — Protokolle, Budgets, Richtlinien.

Am weitesten geht dabei agentgateway, das Projekt hinter dem jüngsten Fachartikel zum Thema: ein in Rust geschriebener, Apache-2.0-lizenzierter Kontrollpunkt unter dem Dach der Linux Foundation, den Solo.io kommerziell veredelt. Es leitet nicht nur Modellanfragen, sondern auch den Verkehr zwischen Agenten und Werkzeugen (MCP) sowie zwischen Agenten untereinander. Das ist die eigentliche Richtung, in die sich die Schicht bewegt: weg vom Modell-Vermittler, hin zur Kontrollebene für Agenten-Infrastruktur.

Der Aussteiger

Ende Juli hat die Firma Manifest, die selbst eine quelloffene Gateway-Plattform betreibt, einen Blogbeitrag mit dem Titel „Why we deprecated our LLM router“ veröffentlicht. Auf Hacker News wurde daraus binnen Stunden eine der meistdiskutierten Fragen der Woche.

Der Ablauf: Manifest führte im März 2026 einen Router ein, der Anfragen in vier Schwierigkeitsstufen einsortierte, um teure Modelle einzusparen. Nach vier Monaten Betrieb mit rund 7.000 Nutzern wurde er im Juni abgekündigt; endgültig abgeschaltet wird er am 1. September 2026. Drei Gründe nennt das Unternehmen.

Erstens: Die Schwierigkeit steht nicht im Prompt. In einem Agenten-Ablauf entsteht der entscheidende Kontext erst unterwegs — durch Werkzeugaufrufe, Websuchen, Zwischenergebnisse. Der Router entscheidet also über die Modellwahl, bevor irgendjemand wissen kann, wie schwer die Aufgabe wird. Er entscheidet blind.

Zweitens: Das Zwischenspeichern wird zerstört. Beide großen Anbieter geben erhebliche Rabatte auf wiederholte Prompt-Anteile — Anthropic rund 90 Prozent auf Cache-Lesevorgänge, OpenAI etwa 50 Prozent. Diese Caches sind anbieterspezifisch. Sobald ein Router zwischen Modellen wechselt, sind sie kalt, und die Ersparnis frisst sich selbst auf.

Drittens: Inkonsistenz kostet Qualität. Wechselt das Modell mitten im Ablauf, ändert sich Ton, Werkzeugverhalten und Formatierung — für Nutzer spürbar als Qualitätsabfall.

Manifests Fazit lautet, die zusätzliche Unsicherheitsschicht könne mehr kosten, als sie einspare; empfohlen wird die bewusste, feste Modellwahl statt der dynamischen.

Die Diskussion darüber ist keineswegs einseitig. Das schärfste Argument gegen Router formulierte ein Kommentator so: Ein Router, der Schwierigkeit zuverlässig einschätzen soll, müsste fast so intelligent sein wie das teuerste Modell, das er einsparen will — womit der Zweck sich selbst untergräbt. Dagegen halten Praktiker zwei Punkte: Der Ertrag skaliert mit dem Volumen, weil die Entwicklungskosten fix bleiben und die Ersparnis linear mit dem Verkehr wächst. Und fachliches Routing — Recht hierhin, Code dorthin — funktioniert erkennbar besser als ein naiver Schwierigkeitswert. Mehrere Entwickler berichten von Erfolg mit fest zugeordneten Modellen pro Agentenrolle. Das ist streng genommen kein Routing mehr, sondern Architektur.

Was die Zahlen hergeben — und was nicht

Die belastbarste unabhängige Quelle bleibt das RouteLLM-Paper von LMSYS und Berkeley. Es zeigt eindrucksvolle Werte: 95 Prozent der Qualität des starken Modells bei nur 26 Prozent der Aufrufe an dieses Modell, ein Kostenfaktor von 3,66. Entscheidend ist aber die Streuung, die in Marketingfolien selten auftaucht: Diese Werte gelten für den Benchmark MT-Bench. Auf MMLU und GSM8K fielen die Einsparungen auf 45 beziehungsweise 35 Prozent. Routing-Ersparnis ist stark aufgabenabhängig und lässt sich nicht pauschal auf die eigene Anwendung übertragen.

Anbieterzahlen sind entsprechend vorsichtig zu lesen. Martian wirbt mit bis zu 98 Prozent Kostenersparnis in „optimierten Produktionsumgebungen“ — eine Herstellerangabe ohne unabhängige Prüfung. NotDiamond verweist auf eine einzelne Kundenfallstudie. Dass die Forschung dieses Problem erkannt hat, zeigt RouterArena, eine 2026 vorgestellte offene Vergleichsplattform, die Router über neun Domänen hinweg an fünf Maßstäben misst — Genauigkeit, Kosten, Optimalität, Robustheit, Latenz. Sie existiert genau deshalb, weil die Anbieterzahlen bislang nicht vergleichbar waren.

Neuere Arbeiten aus 2026 beschreiben zudem zwei Fehlermodi, die in keiner Verkaufsunterlage stehen: den „Routing Collapse“, bei dem ein Router mit der Zeit auf wenige Modelle degeneriert, und gezielte Angriffe, bei denen Prompts so gestaltet werden, dass sie absichtlich falsch geroutet werden — etwa auf das billigste, schwächste Modell.

Wenn der Vermittler selbst ausfällt

Der zusätzliche Netzwerksprung ist meist unkritisch; Anbieter wie Bifrost werben mit Verzögerungen im Mikrosekundenbereich, was gegenüber der Modellantwortzeit nicht ins Gewicht fällt. Das reale Risiko ist ein anderes: Die Schicht, die man gegen Anbieterausfälle einzieht, wird selbst zum Einzelpunkt des Versagens.

Für OpenRouter sind mehrere Störungen dokumentiert, darunter ein rund 50-minütiger Datenbankausfall im August 2025 und ein 38-minütiger im Februar 2026. Drittanbieter-Überwachungsdienste zählen für die vergangenen zwölf Monate mehrere Dutzend kleinere Störungen — Zahlen, die nicht vom Anbieter selbst stammen und entsprechend unscharf sind. Die Konsequenz ist trotzdem eindeutig: Ein Gateway ohne konfigurierten Mehr-Anbieter-Rückfall verschlechtert die Verfügbarkeit, statt sie zu verbessern.

Die Anbieter bauen es inzwischen selbst ein

Die vielleicht wichtigste Verschiebung kommt nicht von den Gateway-Firmen, sondern von den Modellanbietern. OpenAI führte mit GPT-5 im August 2025 einen internen Auto-Router ein — und erlebte prompt einen Vertrauensverlust: Nutzer empfanden das Modell als schwächer, Sam Altman räumte Fehlfunktionen des Umschalters ein, OpenAI musste vorübergehend zurückrudern. Anthropic geht in Claude Code einen ähnlichen Weg mit automatischer Zuweisung von Hintergrundaufgaben an kleinere Modelle.

Dazu kommt die Preisseite. Wie wir in unserer Ausgabe vom 31. Juli berichteten, hat OpenAI am 30. Juli den Preis seines günstigsten Modells um 80 Prozent gesenkt und Geschwindigkeit als separat bepreiste Stufe eingeführt. Je feiner und billiger die Anbieter ihre eigenen Stufen selbst staffeln, desto weniger Marge bleibt für einen externen Vermittler, der genau diese Auswahl treffen wollte.

Was das für die Entscheidung heißt

Die ehrliche Zusammenfassung trennt zwei Dinge, die im Marketing verschmelzen: Gateway und dynamisches Routing. Das eine ist eine Infrastrukturentscheidung, das andere eine Optimierungswette.

Für ein Gateway sprechen vier klare Kriterien: mehrere gleichzeitig genutzte Anbieter, ausreichendes Volumen, damit sich der Betriebsaufwand rechnet, Anforderungen an Datenresidenz und Prüfbarkeit — und Mandantenfähigkeit, wenn Kosten pro Kunde oder Team zugeordnet werden müssen. Der Compliance-Punkt hat dabei gerade an Gewicht gewonnen: Ab dem 2. August 2026 greifen die Durchsetzungsbefugnisse zum EU AI Act, und eine zentrale Schicht mit Protokollierung, Rechteverwaltung und Regeln darüber, welcher Anbieter welche Daten sehen darf, ist der pragmatischste Ort, diese Nachweise zu erzeugen.

Gegen dynamisches Routing sprechen ebenso klare Gegenanzeigen: kleine Volumina, agentische Abläufe mit starker Cache-Abhängigkeit und Anwendungen, deren Qualität an Modellkonsistenz hängt.

Die praktische Empfehlung, die sich aus Forschung und Praxisberichten gleichermaßen ergibt, ist unspektakulär: Die Vermittlungsschicht ja — für Ausweichpfade, Kostenzuordnung und Nachweispflichten. Die automatische Modellwahl eher nein, jedenfalls nicht als Erstes. Wer sparen will, kommt mit einer bewussten, festen Zuordnung von Modell zu Aufgabe weiter als mit einem Router, der raten muss, wie schwer eine Frage wird, bevor er sie gelesen hat.

Quellen