Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Artificial Analysis hat seinen KI-Benchmark „Intelligence Index“ auf Version 4.2 aktualisiert. Neu aufgenommen wurden die Tests „AA-Briefcase“ für Wissensarbeit und „GDP.pdf“ von Surge AI für Dokumentenanalyse. Den Test „GPQA Diamond“ strich das Unternehmen, weil die Werte gesättigt seien. Der Anteil nicht öffentlicher Testdaten stieg von 20 auf 40 Prozent, um Manipulation zu erschweren. In Version 5 soll der Anteil weiter steigen. Laut Unternehmen führt der „Claude Fable 5.1“ von Anthropic die Rangliste an, gefolgt vom „GPT-6 Astra“ von OpenAI. Dieser habe sich gegenüber dem Vorgänger „GPT-5.6 Sol“ um vier Punkte verbessert und eine höhere Ausgabeeffizienz gezeigt. Die Quellen berichten weitgehend übereinstimmend.