Modelle · China
Alibaba liefert Qwen3.8-Max aus: 2,4 Billionen Parameter — und die Gewichte sollen kommende Woche folgen
Alibaba hat am 3. August Qwen3.8-Max allgemein verfügbar gemacht — nach eigener Darstellung das größte und leistungsfähigste Modell, das der Konzern je gebaut hat. Die technischen Eckdaten waren bei der Vorschau Mitte Juli noch offen geblieben; jetzt liegen sie auf dem Tisch. Es handelt sich um ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen pro Anfrage rund 95 Milliarden tatsächlich rechnen. Diese Bauweise ist der Grund, warum ein derart großes Modell überhaupt bezahlbar zu betreiben ist: Statt das gesamte Netz zu aktivieren, wird für jedes Token nur ein kleiner, spezialisierter Teil angesprochen — vergleichbar mit einem Konzern, der für jede Frage nur die zuständige Fachabteilung einschaltet statt die gesamte Belegschaft.
Das Kontextfenster liegt bei einer Million Token, konkret bis zu 991.000 Token Eingabe (983.000 bei aktiviertem Reasoning), 131.000 Token Ausgabe und ein Nachdenk-Budget von bis zu 262.000 Token. Das Modell nimmt Text, Bilder und Video entgegen und gibt Text aus. Die API-Preise nennt Alibaba mit 2,00 Dollar je Million Eingabe-Token und 6,00 Dollar je Million Ausgabe-Token; zwischengespeicherte Eingaben kosten 0,25 Dollar und sind damit achtmal günstiger. Zum Vergleich: Das entspricht exakt dem Eingabepreis, auf den OpenAI vergangene Woche sein Modell Terra gesenkt hat, und liegt deutlich unter Claude Opus 5 mit 5,00 Dollar.
Bei den Benchmarks ist Vorsicht geboten, weil es sich durchweg um Herstellerangaben handelt. Alibaba nennt auf Terminal-Bench 2.1 — einem Test für Aufgaben, die ein Modell selbstständig in einer Kommandozeile erledigen muss — einen Wert von 86,6 gegenüber 84,6 für Claude Opus 4.8 und Claude Fable 5, aber hinter GPT-5.6 Sol mit 88,8. Auf IFBench, das die Genauigkeit beim Befolgen von Anweisungen misst, meldet der Konzern 82,8 gegen 72,7 für GPT-5.6 Sol. Dazu kommen 92,6 auf GPQA Diamond und 93,0 auf PaperBench. Getestet wurde außerdem gegen SWE-bench Pro und einen hauseigenen Test namens NL2Repo-Bench — bei letzterem ist der Vergleichswert naturgemäß wenig aussagekräftig. Auf dem unabhängigen Arena.AI-Leaderboard für Textaufgaben rangiert Qwen3.8-Max nach Angaben von heise online als stärkstes chinesisches Modell, bleibt aber hinter den Anthropic-Modellen zurück.
Der eigentlich bemerkenswerte Teil der Ankündigung steht nicht in der Benchmark-Tabelle. Alibaba will die Gewichte von Qwen3.8-Max kommende Woche über Model Studio veröffentlichen — es wäre das erste Modell der Max-Klasse, dessen Parameter frei heruntergeladen werden können. Parallel dazu ist ein deutlich kleineres Qwen3.8-27B angekündigt. Damit wiederholt sich ein Muster, das inzwischen die Regel ist: Chinesische Anbieter veröffentlichen die Gewichte ihrer Spitzenmodelle, amerikanische halten sie zurück. Über die Washingtoner Debatte, was daraus für die USA folgt, haben wir in unserer Ausgabe vom 21. Juli berichtet — damals lag von Qwen 3.8 nur eine Vorschau ohne Zahlen vor.
Alibaba wirbt vor allem mit Ausdauer statt mit Einzelantworten. Der Konzern führt Beispiele an, in denen das Modell mehrtägige Programmierprojekte ohne menschliches Zutun abgeschlossen habe — eines davon soll 16 Tage gelaufen sein. Es habe außerdem die Ergebnisse eines Forschungspapiers eigenständig reproduziert und verbessert sowie einen simulierten E-Commerce-Betrieb geführt. Auch das sind Herstellerangaben ohne unabhängige Prüfung; belastbare Drittmessungen zur Ausdauer über solche Zeiträume gibt es bislang von keinem Anbieter.
Für Unternehmen in Europa ist die Einordnung der Analysten interessanter als die Benchmark-Punkte. Charlie Dai von Forrester formuliert das Argument nüchtern: Firmen hätten zunehmend glaubwürdige Alternativen zu proprietären Spitzenmodellen, besonders im Software-Engineering, wo Offenheit stark ins Gewicht falle. Nitish Tyagi von Gartner hält dagegen, dass die Inferenzkosten nur ein Teil der Rechnung sind: Sicherheitskontrollen, Haftungsfreistellung und mögliche Auflagen zum Hosting-Standort entscheiden in der Praxis mit. Genau an diesem Punkt wird die Sache für europäische Unternehmen konkret — offene Gewichte lösen das Datenschutzproblem, weil das Modell im eigenen Rechenzentrum läuft, verlagern aber die Verantwortung für Absicherung und Betrieb vollständig ins Haus.
Der Wettbewerbsdruck innerhalb Chinas ist dabei mindestens so bemerkenswert wie der transpazifische. Moonshot AIs Kimi K3 mit 2,8 Billionen Parametern kam nur wenige Wochen zuvor heraus; Alibaba beansprucht, es in mehreren Tests zu übertreffen. Was die Frage nach der Build-oder-Buy-Entscheidung angeht, die offene Modelle für Unternehmen neu stellen, haben wir die Ökonomie dahinter in unserer Reportage vom 21. Juli ausführlich behandelt.
- heise online — Qwen3.8-Max: Alibabas KI-Modell fordert US-Spitzenreiter
- MarkTechPost — Alibaba Qwen Releases Qwen3.8-Max: A 2.4 Trillion Parameter MoE Model
- InfoWorld — Alibaba takes aim at OpenAI and Anthropic with Qwen3.8-Max launch
- The Verge — China's Alibaba takes another swipe at America's AI supremacy
- the decoder — Alibaba's open-weight Qwen3.8-Max takes on long-horizon AI tasks
- t3n — Alibaba veröffentlicht Qwen3.8-Max und heizt den KI-Wettbewerb mit den USA weiter an