Im Quellenvergleich

Alibaba veröffentlicht KI-Modell Qwen

2 Quellen · 3 Meldungen · Stand 27.08.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Alibaba hat das KI-Modell Qwen3.8-Flash-Next veröffentlicht, das als Architektur-Vorschau auf Qwen4 dient. Das Modell nutzt eine Mixture-of-Experts-Architektur und aktiviert pro Token nur 6 Milliarden Parameter. Eine neue N-gram-Embedding-Schicht mit 51 Milliarden Parametern speichert häufige Wortgruppen und läuft im Arbeitsspeicher statt auf der GPU. Der native Kontext umfasst 262.144 Token und ist auf eine Million erweiterbar. Laut Alibaba kostet die Produktionsversion 0,16 US-Dollar pro Million Input-Tokens und 0,47 US-Dollar pro Million Output-Tokens. Das Unternehmen gibt an, das Modell liefere bei etwa einem Neuntel der Trainingskosten von Qwen3.7-Plus bessere Ergebnisse, besonders bei Coding- und Office-Aufgaben. In Benchmarks übertrifft es laut Alibaba meist DeepSeek-V4-Flash und Claude Opus 4.6, etwa bei agentischen Coding-Aufgaben (58,7 Punkte auf DeepSWE, 62,5 auf SWE-bench Pro). Bei wissenschaftlichem Schlussfolgern liegen die Modelle eng beieinander. Die Quellen berichten weitgehend übereinstimmend.

Worin sie sich unterscheidenGesamtzahl der Parameter des Modells·Architekturdetails der Aufmerksamkeitsmechanismen·Geschwindigkeitssteigerung bei langen Kontexten+5 weitere
Gesamtzahl der Parameter des Modells
  • Das Modell hat insgesamt 125 Milliarden Parameter.1
  • Das Modell hat insgesamt 180 Milliarden Parameter.2
Architekturdetails der Aufmerksamkeitsmechanismen
  • Die Architektur kombiniert zwei Mechanismen: 36 von 48 Schichten nutzen Gated DeltaNet, das die Historie komprimiert, und 12 Schichten verwenden die neue Qwen Sparse Attention, die gezielt relevante Kontextbereiche auswählt.2
Geschwindigkeitssteigerung bei langen Kontexten
  • Die Architektur bringt laut Artikel bis zu 8,6-fache Geschwindigkeitssteigerung bei langen Kontexten.2
Auslagerung der N-gram-Tabelle
  • Die N-gram-Tabelle lässt sich in Arbeitsspeicher oder auf SSD auslagern, was den VRAM-Bedarf senkt.2
Laufzeit von 4-Bit-Versionen
  • Laut Unsloth-Dokumentation laufen 4-Bit-Versionen auf Systemen mit 128 GB RAM mit 20 bis 30 Tokens pro Sekunde.2
Vergleichs-Benchmarks
  • In Benchmarks übertrifft das Modell laut Autor die Qwen 3.8 27B bei Agentenaufgaben, Programmierung und Logik und nähert sich Claude Opus 4.8 an.2
Einordnung des Modells als multimodal
  • Das Modell ist multimodal.2
Angebot offener Gewichte
  • Alibaba bietet als einziges Unternehmen offene Gewichte von unter 1B bis über 100B Parametern an.2

Quellen (2)

Vollständige Übersicht mit allen Meldungen öffnen →