Modelle · Google DeepMind
Drei Wochen, halber Preis: Google ersetzt sein Arbeitspferd schneller, als Kunden es einbauen können
Google hat am 13. August Gemini 3.7 Flash veröffentlicht — nach eigener Beschreibung das „intelligenteste Arbeitspferd-Modell" des Hauses. Der Vorgänger Gemini 3.6 Flash war zu diesem Zeitpunkt drei Wochen alt. Es ist das dritte neue Flash-Modell binnen drei Monaten.
Die Zahlen sind unstrittig, weil sie aus der Modellkarte stammen: 1 Million Token Kontext, 64.000 Token maximale Ausgabe, Eingabe als Text, Bild, Audio, Video und PDF, Ausgabe nur als Text. Interessanter ist die Preisgestaltung. Bis zum 31. Dezember 2026 kostet die Million Eingabe-Token 0,75 Dollar, die Million Ausgabe-Token 3,75 Dollar. Ab dem 1. Januar 2027 gelten dann 1,50 beziehungsweise 7,50 Dollar — also das Doppelte. Wer heute auf Basis des Einführungspreises kalkuliert, kalkuliert mit einem Wert, der ein bekanntes Verfallsdatum hat. Das ist keine Fußnote, sondern die relevanteste Zahl des Blogposts für jeden, der ein Budget verantwortet.
Bei den Benchmarks lohnt eine saubere Trennung. Google nennt Sprünge gegenüber 3.6 Flash: FrontierCode 1.1 von 34,4 auf 43,6 Prozent, DeepSWE v1.1 von 49,0 auf 65,3 Prozent, AutomationBench von 17,0 auf 30,4 Prozent, WebDev-Arena-Elo von 1538 auf 1588. Diese Werte stammen durchweg aus Googles eigenem Blogpost, auch wenn die Messung teils bei Dritten lag (Cognition, DataCurve, Zapier, Arena.ai). heise weist ausdrücklich darauf hin, dass es sich durchgängig um Googles eigene Zahlen handelt.
Unabhängig gemessen hat Artificial Analysis: 56 Punkte im Intelligence Index v4.1.1, Rang 17 von 188, 340 Ausgabe-Token pro Sekunde über Googles API, 0,40 Dollar Kosten pro Index-Aufgabe. Der Zuwachs gegenüber 3.6 Flash beträgt vier Punkte. Damit liegt das Modell knapp hinter GPT-5.6 Terra und Metas Muse Spark 1.2 (je 57 Punkte), erreicht aber laut Artificial Analysis die Pareto-Front aus Intelligenz und Zeit pro Aufgabe — es gibt also kein Modell, das gleichzeitig schneller und klüger ist.
Für Agenten nennt Google eine konkretere Zahl: 35 Prozent geringere Kosten in Agenten-Arbeitsabläufen gegenüber 3.6 Flash, bei acht Prozentpunkten höherer Prompt-Cache-Trefferquote und weniger Werkzeugfehlern. Die Angabe stammt aus einer Auswertung des Kunden Box und ist damit Herstellerkontext, keine unabhängige Messung — die Richtung ist aber plausibel, weil ein höherer Cache-Treffer bei fast allen Anbietern direkt auf die Rechnung durchschlägt.
Am selben Tag verließ DeepSeeks V4-Pro die Preview-Phase und ging in der Version 0813 in die allgemeine Verfügbarkeit. Wichtig für die Einordnung: Das ist kein Neu-Launch, sondern die Reifestufe einer bereits im April 2026 vorgestellten Architektur — ein Mixture-of-Experts-Modell mit 1,6 Billionen Gesamt- und 49 Milliarden aktiven Parametern pro Token, offene Gewichte unter MIT-Lizenz, ebenfalls 1 Million Token Kontext. Die genannten Benchmarkwerte (SWE-bench Verified 80,6 Prozent, GPQA Diamond 90,1 Prozent, LiveCodeBench 93,5 Prozent) sind Herstellerangaben; techtimes formuliert unmissverständlich, dass für den 0813-Build bislang keine dieser Spalten von einem unabhängigen Prüfer reproduziert wurde. Auch die Preisangaben gehen zwischen den Quellen auseinander, weshalb wir hier keine nennen.
Der eigentliche Befund liegt in einer Leerstelle. Googles Blogpost erwähnt Gemini 3.5 Pro mit keinem Wort — das Flaggschiff, das Sundar Pichai auf der I/O im Mai binnen eines Monats angekündigt hatte. Am 21. Juli sagte Produktverantwortlicher Logan Kilpatrick gegenüber TechCrunch, man teste es „derzeit mit Partnern" und hoffe, es lande „bald" — ohne Datum. Bloomberg berichtete, das Modell habe interne Leistungsziele verfehlt. Stattdessen kamen im Juli drei Flash-Modelle. Und nun ein viertes.
Für Unternehmen ergibt sich daraus eine unangenehme Rechnung, die nichts mit Modellqualität zu tun hat. Ein Anbieter, der sein Arbeitspferd im Dreiwochentakt ersetzt, verlangt von seinen Kunden implizit eine Integrationsarchitektur, in der das Modell austauschbar ist. Wer Prompts, Auswertungen und Feinabstimmungen fest auf eine Modellversion verdrahtet, zahlt diesen Takt in Ingenieursstunden. Die kluge Reaktion auf Gemini 3.7 Flash ist deshalb weniger die Frage „sollen wir wechseln?" als die Frage, wie teuer der nächste Wechsel wird — und ob die eigenen Auswertungen automatisiert genug sind, um ihn in Tagen statt in Wochen zu beantworten. Wie schnell Google beim Verteilungsvorsprung ist, haben wir gestern beschrieben; beim Flaggschiff ist von Tempo weiterhin nichts zu sehen.
- Google Blog — Introducing Gemini 3.7 Flash
- Google DeepMind — Model Card Gemini 3.7 Flash
- Artificial Analysis — Gemini 3.7 Flash
- heise online — AI Models: Google Gemini 3.7 Flash, OpenAI Ultrafast, DeepSeek V4-Pro
- the-decoder — Gemini 3.7 Flash lands with coding gains
- TechTimes — DeepSeek V4-Pro 0813 goes GA, benchmark claims await independent proof
- TechCrunch — Google releases three new Gemini models, but no 3.5 Pro (21.7.2026)