Modelle · Sprachagenten
Google bringt Sprachagenten zum Minutenpreis — und die Modellkarte verrät, dass die neuen 3.8-Modelle gar nicht auf Gemini 3.8 aufbauen
Google hat am Montagabend europäischer Zeit zwei Modelle vorgestellt, die man leicht für ein Zwischenupdate hält und die für jeden interessant sind, der über Kundentelefonie oder Sprachbedienung nachdenkt: Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Wir haben die Ankündigung und die zugehörige Modellkarte im Original gelesen.
Was die beiden unterscheidet, sagt Google in einem Satz: „Gemini 3.8 Live: Built for scale and cost efficiency, combining conversational intelligence with fluid dialogue and visual grounding. Gemini 3.8 Live Extended Thinking: Built for high-complexity tasks, with increased intelligence and multi-step reasoning.“ Das eine ist das billige Arbeitstier, das andere das teure für komplizierte Fälle.
Technisch bemerkenswert ist weniger die Sprachqualität als die Gesprächsführung. Die Modelle nehmen Audio, Bilder, Video und Text entgegen — Kontextfenster 128K, Ausgabe bis 64K Token — und antworten mit Audio und Text. Sie erkennen laut Google Sprachwechsel selbsttätig und schalten „between 97 supported languages mid-conversation“ um, also ohne dass jemand eine Einstellung ändert. Vor allem aber führen sie Werkzeug- und API-Aufrufe im Hintergrund aus, während das Gespräch weiterläuft. Die Extended-Thinking-Variante „reasons and speaks simultaneously“: Sie schiebt Füllsätze wie „Let me check that…“ ein und erzählt mit, was sie gerade tut.
Das klingt nach Kosmetik, ist aber der eigentliche Engpass von Sprachagenten. Bisher entstand genau dort die tote Leitung, an der Anrufer auflegen: Der Agent muss eine Datenbank fragen und schweigt so lange. Wer Telefonie automatisiert, kennt diese Sekunden als den Punkt, an dem Gespräche abbrechen.
Die Rangplätze, mit denen Google wirbt, stammen von Google. Genannt werden für Extended Thinking der erste Platz auf dem Speech-to-Speech-Quality-Index von Artificial Analysis mit 82,6, dazu „68.6% on τ-Voice and 35.1% on Sierra's τ-Voice-banking benchmark“ sowie 97,7 Prozent auf Big Bench Audio; die günstigere Variante belegt Platz zwei in der Speech Agent Arena. Keine dieser Zahlen ist von Dritten nachgemessen worden, und zu dieser Ankündigung liegt zum Redaktionsschluss keine Berichterstattung der etablierten Fachpresse vor, die sie überprüft hätte. Bei der ServiceNow-Messung EVA-Bench vermerkt Google in einer Fußnote selbst, der Lauf sei auf der eigenen Enterprise-Plattform erfolgt.
Zwei Angaben aus der Modellkarte verdienen mehr Aufmerksamkeit als die Ranglisten. Die erste: „Gemini 3.8 Audio is based on Gemini 3 Pro.“ Die Modelle heißen 3.8, bauen aber nicht auf dem Anfang September vorgestellten Gemini 3.8 Flash auf, sondern auf der Pro-Linie. Die Versionsnummer beschreibt hier eine Veröffentlichungswelle, keine gemeinsame Grundlage — wer Modelle nach Nummern vergleicht, vergleicht das Falsche.
Die zweite steht im Sicherheitsteil und lautet wörtlich: „Our assessments have shown that Gemini 3.8 Live or Gemini 3.8 Live Extended Thinking does not have meaningful new capabilities or material increases in performance compared to Gemini 3.7 Flash.“ Dieser Satz ist zu genau zu lesen, damit er nicht mehr hergibt, als er sagt: Er steht im Rahmen des Frontier Safety Framework und begründet, warum Google auf eine eigene Gefährdungsprüfung verzichtet und die Ergebnisse von Gemini 3.7 Flash übernimmt. Er behauptet nicht, die Sprachqualität sei unverändert. Trotzdem steht er in einer bemerkenswerten Spannung zur Ankündigung: Dieselbe Firma, die den ersten Platz reklamiert, versichert in der Modellkarte, es habe keinen materiellen Leistungssprung gegeben.
Kaufmännisch interessant ist die Preisstruktur, und sie steht nicht in der Ankündigung. Auf Googles Preisseite werden beide Modelle identisch geführt: Audio-Eingabe 3,00 Dollar je Million Token oder wahlweise 0,005 Dollar pro Minute, Audio-Ausgabe 12,00 Dollar oder 0,018 Dollar pro Minute, Bild und Video 0,002 Dollar pro Minute. Der Minutenpreis ist die eigentliche Nachricht für Unternehmen: Eine Gesprächsminute kostet in der Größenordnung von gut zwei Cent an Modellkosten. Damit wird nicht mehr das Modell zum Kostentreiber, sondern die Telefonieinfrastruktur, die Anbindung an die Fachsysteme und die Nachbearbeitung.
Die Verfügbarkeit ist ungleich verteilt, und das ist für Planungen wichtiger als jeder Benchmark. Für Entwickler sind beide Modelle ab sofort in der Gemini-API und im AI Studio verfügbar. Für Unternehmen dagegen gilt: „in private preview in Gemini Enterprise“ — also geschlossene Vorschau, keine Zusage für den Produktivbetrieb. Wer die Modelle heute in einen Kundenkanal einbauen will, baut auf der Entwicklerschnittstelle, nicht auf dem Enterprise-Produkt. Alle erzeugten Audiodateien tragen das SynthID-Wasserzeichen.
Was man aus dieser Ankündigung mitnehmen sollte, ist weniger die Rangliste als die Verschiebung: Sprachagenten sind keine Demo mehr, sondern eine Position im Einkauf mit einem Minutenpreis. Die belastbare Prüfung findet damit nicht auf einer öffentlichen Rangliste statt, sondern an den eigenen Gesprächen — und die Frage, die man dem Anbieter stellen sollte, lautet nicht, welchen Platz er belegt, sondern was passiert, wenn das Fachsystem im Hintergrund vier Sekunden braucht.
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (15.9.2026, Tom Ouyang und Malini Jaganathan; Primärquelle, selbst im Volltext gelesen)
- Google DeepMind — Model Card: Gemini 3.8 Audio (Live, Live Extended Thinking), veröffentlicht 15.9.2026 (selbst gelesen, Zitate per Volltextsuche geprüft)
- Google — Gemini Developer API pricing (offizielle Preisseite, Minutenpreise selbst abgelesen)
- Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (2.9.2026, zum Vergleich der Modelllinien)
- MarkTechPost — Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents (15.9.2026)