Im Quellenvergleich

Alibaba veröffentlicht Qwen3.8-Max

8 Quellen · 11 Meldungen · Stand 22.08.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Alibaba hat sein KI-Modell Qwen3.8-Max am 3. August 2026 einem breiten Publikum zugänglich gemacht. Das Modell hat laut Alibaba 2,4 Billionen Parameter. Die Modellgewichte sollen zusammen mit dem kleineren Modell Qwen3.8-27B nächste Woche veröffentlicht werden. Alibaba positioniert Qwen3.8-Max als besonders geeignet für autonomes Programmieren, komplexe Recherchen und andere langwierige Aufgaben. Das Modell kann verschiedene Datentypen verarbeiten, etwa lange Dokumente, Fernsehserien und Live-Streams, um durchsuchbare Wissensdatenbanken aufzubauen. Laut dem Unternehmen kann das Modell außerdem Software-Anwendungen aus Screenshots nachbilden, interaktive Spiele und Lernanimationen erzeugen sowie zweidimensionale Grundrisse in 3D-Darstellungen umwandeln. Das Modell läuft über die Dienste Qwen Studio und QwenCloud. Der API-Preis beträgt 2 Dollar pro Million Tokens für Eingaben und 6 Dollar für Ausgaben. Alibaba bezeichnet Qwen3.8-Max als sein bislang größtes und leistungsfähigstes Modell. Laut Unternehmensangaben spielt es in einer Liga mit den Spitzenmodellen der US-Anbieter OpenAI und Anthropic. Die Ergebnisse stammen aus internen Läufen, eine unabhängige Verifikation steht aus. Das Modell hat eine Kontextfenster von einer Million Tokens. Von den 2,4 Billionen Gesamtparametern sind 95 Milliarden pro Anfrage aktiv. Das Modell ist multimodal und kann laut Alibaba in einigen Benchmarks die Konkurrenzmodelle Claude Fable 5 von Anthropic und GPT-5.6 Sol von OpenAI übertreffen. Beim Programmier-Benchmark Terminal Bench 2.1 übertraf es demnach Claude Fable 5, bei SWE-bench Pro lag es vor GPT-5.6 Sol. Beim Benchmark DeepSWE 1.1 für Codierungsagenten schnitt es jedoch schlechter ab als beide. In einer Demo arbeitete das Modell über zehn Tage autonom an Programmieraufgaben. Laut Unternehmen zeigte es auch Stärken bei der Überarbeitung von Forschungsarbeiten, juristischen Aufgaben und Webdesign. Das Team führt die Leistung auf erweitertes Reinforcement Learning zurück. Der Konkurrent Kimi K3 von Moonshot AI kommt auf 2,8 Billionen Parameter. Auf der Plattform Arena.AI war Qwen3.8-Max bei Textaufgaben das bestplatzierte chinesische Modell, lag aber hinter Modellen von Anthropic. Besonders stark war es bei der Bildauswertung. Das 27-Milliarden-Parameter-Modell Qwen3.8-27B eignet sich für lokale, private Nutzung auf PCs. Die Modellgewichte sollen auf Hugging Face und ModelScope erscheinen. Das Modell kann laut Alibaba Software-Anwendungen aus Screenshots nachbilden, interaktive Spiele und Lernanimationen erzeugen sowie zweidimensionale Grundrisse in 3D-Darstellungen umwandeln. In einer Demo arbeitete das Modell über zehn Tage autonom an Programmieraufgaben. Laut Unternehmen zeigte es auch Stärken bei der Überarbeitung von Forschungsarbeiten, juristischen Aufgaben und Webdesign. Das Team führt die Leistung auf erweitertes Reinforcement Learning zurück. Der Konkurrent Kimi K3 von Moonshot AI kommt auf 2,8 Billionen Parameter. Auf der Plattform Arena.AI war Qwen3.8-Max bei Textaufgaben das bestplatzierte chinesische Modell, lag aber hinter Modellen von Anthropic. Besonders stark war es bei der Bildauswertung. Das 27-Milliarden-Parameter-Modell Qwen3.8-27B eignet sich für lokale, private Nutzung auf PCs. Die Modellgewichte sollen auf Hugging Face und ModelScope erscheinen. Die finale Version des Modells wurde am 3. August veröffentlicht. Die Denkfunktion ist standardmäßig aktiviert. Die kompakte 27B-Version läuft laut Ankündigung auf einer RTX 5090 oder Apple Silicon. Die offenen Gewichte waren am 10. August noch nicht verfügbar. Eine lokale Ausführung des Modells bräuchte etwa 4,8 Terabyte Speicher.

Aktualisierungen
03.08.2026
10:07Laut dem Unternehmen kann das Modell außerdem Software-Anwendungen aus Screenshots nachbilden, interaktive Spiele und Lernanimationen erzeugen sowie zweidimensionale Grundrisse in 3D-Darstellungen umwandeln.
11:07Alibaba bezeichnet Qwen3.8-Max als sein bislang größtes und leistungsfähigstes Modell.
Laut Unternehmensangaben spielt es in einer Liga mit den Spitzenmodellen der US-Anbieter OpenAI und Anthropic.
Die Ergebnisse stammen aus internen Läufen, eine unabhängige Verifikation steht aus.
Das Modell hat eine Kontextfenster von einer Million Tokens.
Von den 2,4 Billionen Gesamtparametern sind 95 Milliarden pro Anfrage aktiv.
04.08.2026
00:06Das Modell ist multimodal und kann laut Alibaba in einigen Benchmarks die Konkurrenzmodelle Claude Fable 5 von Anthropic und GPT-5.6 Sol von OpenAI übertreffen.
Beim Programmier-Benchmark Terminal Bench 2.1 übertraf es demnach Claude Fable 5, bei SWE-bench Pro lag es vor GPT-5.6 Sol.
Beim Benchmark DeepSWE 1.1 für Codierungsagenten schnitt es jedoch schlechter ab als beide.
In einer Demo arbeitete das Modell über zehn Tage autonom an Programmieraufgaben.
Laut Unternehmen zeigte es auch Stärken bei der Überarbeitung von Forschungsarbeiten, juristischen Aufgaben und Webdesign.
Das Team führt die Leistung auf erweitertes Reinforcement Learning zurück.
Der Konkurrent Kimi K3 von Moonshot AI kommt auf 2,8 Billionen Parameter.
Auf der Plattform Arena.AI war Qwen3.8-Max bei Textaufgaben das bestplatzierte chinesische Modell, lag aber hinter Modellen von Anthropic.
Besonders stark war es bei der Bildauswertung.
Das 27-Milliarden-Parameter-Modell Qwen3.8-27B eignet sich für lokale, private Nutzung auf PCs.
01:06Die Modellgewichte sollen auf Hugging Face und ModelScope erscheinen.
22.08.2026
16:08Die finale Version des Modells wurde am 3. August veröffentlicht.
Die Denkfunktion ist standardmäßig aktiviert.
Die kompakte 27B-Version läuft laut Ankündigung auf einer RTX 5090 oder Apple Silicon.
Die offenen Gewichte waren am 10. August noch nicht verfügbar.
Eine lokale Ausführung des Modells bräuchte etwa 4,8 Terabyte Speicher.
Worin sie sich unterscheidenBenchmark-Leistung im Vergleich zu Konkurrenzmodellen·Demonstration der Fähigkeiten·Open-Source-Status+5 weitere
Benchmark-Leistung im Vergleich zu KonkurrenzmodellenLaut internen Benchmarks übertrifft das Modell die Konkurrenz in einigen Tests, bleibt in anderen dahinter.
  • Im OSWorld-Verified-Test erreicht das Modell 86,1 Punkte, GPT-5.6 Sol Max kommt auf 83,2, Fable 5 auf 85,0.1
  • Im Artificial Analysis Intelligence Index erreicht das Modell 56 Punkte, gleichauf mit Claude Opus 4.8, vor GLM-5.2 (51), aber hinter Kimi K3 (57).2
  • Im allgemeinen Intelligence Index erreicht das Modell 58,1 Punkte, Claude Fable 5 liegt mit 62,1 Punkten vorn.3
  • Im Agentic Index, der Aufgaben mit Werkzeugnutzung misst, gewinnt das Modell mit 58,4 zu 56,6 Punkten gegen Claude Fable 5.3
  • Ein unabhängiger Test kam zum gegenteiligen Ergebnis: Das Modell landete mit der besten Einstellung im Mittelfeld, mit der Standardeinstellung auf dem letzten Platz.1
Demonstration der FähigkeitenDas Modell arbeitete über zehn Tage autonom an Programmieraufgaben.
  • Das Modell baute über 16 Tage das Kommandozeilen-Werkzeug oh-my-cli auf, ohne menschliches Eingreifen.4
  • Beim Projekt „Oh My CLI“ arbeitete die KI 16 Tage ohne menschliche Eingriffe und erledigte dabei 265 Commits, 127 Pull Requests und 151 Issues.5
  • Es reproduzierte die Ergebnisse eines Forschungspapiers und übertraf sie auf dem Mathematik-Benchmark AIME24 um 2,7 Punkte.4
  • In einem anderen Experiment verbesserte das Modell eine akademische Studie und steigerte das Ergebnis im Mathe-Test AIME24 um 2,7 Punkte.5
  • Bei einer Wettbewerbsaufgabe schlug es 458 von 526 menschlichen Teams.4
  • Einen Chip-Entwurf reduzierte es von 8.298 auf 678 Logikgatter.4
  • In einer E-Commerce-Simulation vervierfachte es ein Startkapital von 100.000 Yuan auf 416.252 Yuan.4
Open-Source-StatusDie Modellgewichte sollen nächste Woche veröffentlicht werden.
  • Die offenen Gewichte wurden für die Woche nach dem Release angekündigt, waren aber am 10. August noch nicht verfügbar.6
  • Die Lizenzbedingungen sind noch unklar; eine permissive Lizenz würde die Nutzung erleichtern, eine restriktive könnte die Verbreitung einschränken.1
Geopolitische Einordnung
  • Die US-Chiprestriktionen von 2022 hätten China kaum gebremst, die Abhängigkeit von den USA sei fast verschwunden.7
  • Der Artikel sieht darin einen Beleg für den harten Wettbewerb in Chinas KI-Branche und wachsenden Druck auf US-Anbieter.8
Preisvergleich mit KonkurrenzmodellenDer API-Preis beträgt 2 Dollar pro Million Tokens für Eingaben und 6 Dollar für Ausgaben.
  • Das ist weniger als ein Drittel des Preises von Claude Opus 5 und unter einem Viertel von GPT-5.6 Sol Max.1
  • Claude Fable 5 kostet 10 Dollar Eingabe und 50 Dollar Ausgabe; damit ist das Modell etwa fünfmal günstiger beim Eingang und rund 8,3-mal günstiger beim Ausgang.6
  • Gegenüber dem Vorgänger Qwen3.7 Max (2,50/7,50 Dollar) ist das Modell 20 Prozent billiger.6
Kosten pro Aufgabe und Effizienz
  • Eine Aufgabe im Intelligence Index kostet 1,14 Dollar, mehr als doppelt so viel wie bei Qwen3.7 Max (0,53).2
  • Kimi K3 kommt bei einem Punkt mehr auf 0,86 Dollar, GLM-5.2 auf 0,57 Dollar.2
  • Das Modell benötigt 64 statt 14 Arbeitsschritte pro Aufgabe, die Eingabe-Token stiegen um das 15-fache, weil bei jedem Schritt der bisherige Gesprächsverlauf erneut gesendet wird.2
  • Beim Test erzeugte das Modell rund 150 Millionen Token, etwa 2,3-mal mehr als vergleichbare Modelle.6
Halluzinationsrate und Zuverlässigkeit
  • Die Halluzinationsrate steigt von 23 auf 40 Prozent: Das Modell rät also häufiger, statt zu passen.2
  • Die Halluzinationsrate stieg laut Analyse von 23 auf 40 Prozent; Alibaba führt die Abweichung auf überlastete Server zurück.6
Bewertung nach Kosten pro erfolgreicher Aufgabe
  • Der Autor fordert, Modelle nicht nach Preis pro Token zu bewerten, sondern nach Kosten pro erfolgreicher Aufgabe: Gesamtausgaben geteilt durch tatsächlich bestandene Aufgaben.1
  • Zudem sollten Zeit- oder Token-Budgets explizit Teil der Akzeptanzkriterien sein; ein Modell, das viel auf Denken verwendet, kann sein Token-Limit erreichen, bevor es eine Antwort schreibt.1

Quellen (8)

Vollständige Übersicht mit allen Meldungen öffnen →