Im Quellenvergleich
Worin die Quellen übereinstimmen
xAI hat am 21. September 2026 das Modell Grok 4.7 vorgestellt. Es ist das leistungsstärkste Modell des Unternehmens für Programmierung und Wissensarbeit. Grok 4.7 basiert auf einem größeren Basismodell als der Vorgänger Grok 4.6 und wurde mit längerem Reinforcement Learning sowie schwierigeren, teils stundenlangen Aufgaben trainiert. Das Modell soll die eigene Arbeit prüfen und lange Kontexte besser verarbeiten. Die API kostet 2 Dollar pro Million Input-Tokens und 6 Dollar pro Million Output-Tokens. Grok 4.7 ist über die Grok-API, Cursor und Grok Build verfügbar. Im Artificial Analysis Intelligence Index erreicht Grok 4.7 einen Score von 46, während Claude Fable 5.1 und GPT-6 mit je 53 Punkten führen. Beim agentischen Coding liegt Grok 4.7 im Terminal-Bench 4.0 hinter der Konkurrenz. Die Quellen berichten weitgehend übereinstimmend.
Worin sie sich unterscheidenBezeichnung des Unternehmens·Preis im Vergleich zum Vorgängermodell·Verfügbarkeit einer schnelleren Variante+9 weitere
Bezeichnung des UnternehmensDas Modell stammt vom Unternehmen SpaceXAI.12 Preis im Vergleich zum Vorgängermodell- Grok 4.7 kostet und läuft so schnell wie der Vorgänger Grok 4.6.2
- Im Vergleich zu Modellen derselben Klasse ist Grok 4.7 doppelt so schnell und kostet die Hälfte.2
Verfügbarkeit einer schnelleren Variante- Eine schnellere Version mit doppelter Ausgabegeschwindigkeit und doppeltem Preis ist ebenfalls erhältlich.2
Training auf das Harness des KI-Agenten Grok Bot- Grok 4.7 wurde darauf trainiert, das Harness des unternehmenseigenen KI-Agenten Grok Bot nativ zu verstehen, was Konversationsaufgaben und allgemeine Wissensarbeit verbessern soll.2
Ergebnis im Terminal-Bench 4.0- Im Terminal-Bench 4.0 erreicht Grok 4.7 einen Wert von 26 Prozent.1
- Im Terminal-Bench 4.0 erreicht Grok 4.7 einen Wert von 38,0 Prozent.2
Vergleichswerte im Terminal-Bench 4.0- Im Terminal-Bench 4.0 kommt GPT-6 Astra auf 60 Prozent und Claude Fable 5.1 auf 52 Prozent.1
- Im Terminal-Bench 4.0 liegt Claude Fable 5.1 bei 57,9 Prozent.2
Weitere Modelle im Terminal-Bench 4.0- Im Terminal-Bench 4.0 liegt DeepSeek V4.1 Flash mit 27 Prozent knapp vor Grok 4.7.1
Ergebnis im CursorBench 4.0- Im CursorBench 4.0 erreicht Grok 4.7 laut Unternehmen 46,3 Prozent und liegt damit über Grok 4.6 (40,4 Prozent) und GPT-5.6 Sol (41,7 Prozent), aber unter Claude Fable 5.1 (51,8 Prozent).2
Führende Ergebnisse in EEBench und Harvey Legal Agent Benchmark- In EEBench (64,0 Prozent) und im Harvey Legal Agent Benchmark (19,6 Prozent) führt Grok 4.7 das Vergleichsfeld an.2
Ergebnis im HealthBench Professional- Im HealthBench Professional erreicht Grok 4.7 56,7 Prozent und liegt unter GPT-5.6 Sol (60,5 Prozent) und Claude Fable 5.1 (62,1 Prozent).2
Ergebnis im GDPval- Im GDPval erreicht Grok 4.7 einen Elo-Wert von 1695, hinter Claude Fable 5.1 (1735), aber vor Grok 4.6 (1605) und GPT-6 Astra (1542).2
Sicherheitsmechanismen und Red-Team-Zugang- Die Sicherheitsmechanismen wurden erneuert; bei Ablehnungsantworten und Jailbreak-Resistenz sei das Modell das stärkste getestete.2
- Im LatchBio-Benchmark zur Biologiesicherheit führt Grok 4.7 mit 62,4 Prozent.2
- Im eigenen HackerBench v0.3 ließ Grok 4.7 3,3 Prozent riskanter Dual-Use-Prompts durch.2
- Einige Cybersicherheitspartner erhalten eingeladenen Zugang zu Red-Team-Funktionen.2