Im Quellenvergleich
Worin die Quellen übereinstimmen
Das KI-Modell „Ox Alpha“ erschien ohne offizielle Ankündigung, Paper oder bekannten Hersteller und ist über Plattformen wie OpenRouter kostenlos verfügbar. Es wird als Reasoning-Modell für Coding, agentische Arbeit und Produktionslasten beschrieben. Die Herkunft des Modells ist unklar; Spekulationen reichen von einer neuen Version des GLM-Modells von Z.ai über ein Gemini-Modell bis zu einem MAI-Modell von Microsoft. Stripe-CEO Patrick Collison, dessen Firma OpenRouter übernimmt, lobte das Modell als „sehr beeindruckend“. Das Modell verarbeitet Text, Bilder und Video. Die Kontextfenster-Größe beträgt 1,05 Millionen Tokens, die Ausgabe bis zu 128K Tokens. Die Quellen berichten weitgehend übereinstimmend. Das Modell erschien am 20. August auf OpenRouter. Die Nutzung stieg rasant: Am 21. August registrierte OpenRouter rund 27 Millionen Anfragen, vier Tage später knapp 79 Millionen. Ein unabhängiger Test mit dem Programmier-Benchmark DeepSWE löste 66 von 113 Aufgaben (58,4 Prozent). Die Herkunft ist inzwischen bestätigt: Z.ai gab Bloomberg gegenüber an, dass Ox Alpha eine neue Variante seiner GLM-Modellreihe ist. Das Unternehmen will die Modellgewichte veröffentlichen und den Zugang eine Woche kostenlos anbieten. Das Modell kann externe Werkzeuge aufrufen. Die Spitzenreiter im offiziellen Leaderboard erreichen 74, 73 und 70 Prozent. Z.ai enthüllte, dass das Modell in Wahrheit „GLM-5.3-Flash“ heißt. Die Inferenz lief während der Testphase auf einem Cluster mit chinesischen KI-Chips. Die Modellgewichte wurden unter der MIT-Lizenz veröffentlicht. Die kumulierte Token-Nutzung erreichte 17,5 Billionen, womit es in der Wochenrangliste Platz eins belegte. GLM-5.3-Flash hat 320 Milliarden Gesamtparameter, aktiv sind 18 Milliarden. Die Kosten pro Token entsprachen nach Firmenangaben denen von NVIDIA-GPUs. Das Modell erreicht im „Artificial Analysis Intelligence Index“ 57 Punkte.
Aktualisierungen
25.08.2026
09:07Das Modell verarbeitet Text, Bilder und Video.
Die Kontextfenster-Größe beträgt 1,05 Millionen Tokens, die Ausgabe bis zu 128K Tokens.
26.08.2026
11:07Das Modell erschien am 20. August auf OpenRouter.
Die Nutzung stieg rasant: Am 21. August registrierte OpenRouter rund 27 Millionen Anfragen, vier Tage später knapp 79 Millionen.
Ein unabhängiger Test mit dem Programmier-Benchmark DeepSWE löste 66 von 113 Aufgaben (58,4 Prozent).
27.08.2026
01:06Die Herkunft ist inzwischen bestätigt: Z.ai gab Bloomberg gegenüber an, dass Ox Alpha eine neue Variante seiner GLM-Modellreihe ist.
Das Unternehmen will die Modellgewichte veröffentlichen und den Zugang eine Woche kostenlos anbieten.
Das Modell kann externe Werkzeuge aufrufen.
Die Spitzenreiter im offiziellen Leaderboard erreichen 74, 73 und 70 Prozent.
05:07Z.ai enthüllte, dass das Modell in Wahrheit „GLM-5.3-Flash“ heißt.
Die Inferenz lief während der Testphase auf einem Cluster mit chinesischen KI-Chips.
Die Modellgewichte wurden unter der MIT-Lizenz veröffentlicht.
Die kumulierte Token-Nutzung erreichte 17,5 Billionen, womit es in der Wochenrangliste Platz eins belegte.
GLM-5.3-Flash hat 320 Milliarden Gesamtparameter, aktiv sind 18 Milliarden.
Die Kosten pro Token entsprachen nach Firmenangaben denen von NVIDIA-GPUs.
Das Modell erreicht im „Artificial Analysis Intelligence Index“ 57 Punkte.
Worin sie sich unterscheidenUrsprung des Modells·Bewertung der Geheimniskrämerei·Nutzungsbedingungen und Datenschutz+5 weitere
Ursprung des ModellsDie Herkunft ist unklar; Spekulationen reichen von einer neuen Version des GLM-Modells von Z.ai über ein Gemini-Modell bis zu einem MAI-Modell von Microsoft.- Ein Artikel auf Wccftech vermutete zunächst GLM, dann eine unveröffentlichte Version von Microsofts MAI.1
- Auf Reddit gibt es widersprüchliche Einschätzungen: Ein Beitrag hält chinesische Herkunft für ausgeschlossen, ein anderer für sehr wahrscheinlich.1
- Hinweise auf Server in den USA sprächen gegen GLM.2
- Analysen von Tokenisierung und API-Fehlern deuten auf eine Verbindung zur chinesischen Firma Z.ai und deren GLM-Modellreihe hin.3
- Ein Insider deutet an, die wahre Herkunft werde viele überraschen.3
Bewertung der Geheimniskrämerei- Der Autor sieht in der Geheimniskrämerei eine erfolgreiche Marketingkampagne, die für Aufmerksamkeit sorge.2
- OpenRouter hat bereits früher anonyme Modelle veröffentlicht; Ox Alpha gilt als Blindtest vor einer offiziellen Ankündigung.3
Nutzungsbedingungen und DatenschutzDer Anbieter behält die Prompts, gibt aber an, sie nicht zum Training zu nutzen.- Die Bedingungen des Stealth-Programms erlauben jedoch auch Training und Evaluation.4
- Sensible Daten sollten nicht übermittelt werden, da der Anbieter die Prompts behält.2
Leistung im Programmier-BenchmarkEin unabhängiger Test mit dem Programmier-Benchmark DeepSWE löste 66 von 113 Aufgaben (58,4 Prozent).- Ein früher Test mit zehn Aufgaben aus dem Coding-Benchmark DeepSWE zeigte 80 Prozent Erfolgsquote.5
- Fast zehn Prozent der Fehler seien auf Formatierungsprobleme zurückzuführen.2
Erfolg und VerbreitungInnerhalb weniger Tage erreichte Ox Alpha Platz 1 der Token-Verbrauchs-Rankings.- Beim Codier-Agenten OpenCode liegt der Verbrauch bei 31 Billionen Token.3
- Bei Cline erreichte das Modell laut Anbieter das schnellste Wachstum der Geschichte.3
Preis und Verfügbarkeit nach der Enthüllung- Das Modell wird auf chinesischer Infrastruktur betrieben und kostet 15 Cent pro Million Input- und 50 Cent pro Million Output-Token.6
- OpenRouter bietet bis zum 9. September einen Rabatt von 50 Prozent.6
- Die Kosten pro Aufgabe betragen etwa ein Siebtel des Spitzenmodells GLM-5.3.3
Einordnung und wirtschaftliche Bedeutung- Die Veröffentlichung ist Teil der Bedrohung durch günstige, leistungsfähige chinesische Modelle, die teuren Frontier-Modellen wie denen von OpenAI und Anthropic Marktanteile abnehmen könnten.7
- Chinesische Modelle wie GLM-5.3-Flash senken die Kosten für KI-Workloads massiv und Unternehmen müssen ihre Ausgaben überdenken.6
- Der Autor empfiehlt, KI-Aufgaben in drei Stufen zu organisieren: teure Top-Modelle für wenige kritische Aufgaben, mittlere Modelle für den Alltag und GLM-5.3-Flash für die Masse der Aufgaben.6
Leistungsbewertung im Vergleich- Laut Z.ai erreicht es eine Leistung nahe dem Claude Opus 4.8 von Anthropic zu niedrigen Kosten.8
- Das Modell erreicht einen Intelligenzindex von 57, während US-Modelle wie GPT-5.6 Sol (Index 59) deutlich teurer sind.6