Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
OpenAI gab bekannt, dass GPT-5.6 Sol im Logik-Benchmark ARC-AGI-3 mit zwei speziellen API-Einstellungen („Retained Reasoning“ und „Compaction“) 38,3 Prozent erreicht und damit den bisherigen Bestwert von Anthropics Claude Opus 5 (30,2 Prozent) übertrifft. In der offiziellen Testumgebung erreichte GPT-5.6 Sol nur 7,8 Prozent, da dort das interne Denken nach jeder Aktion verworfen wird. ARC-Prize-Mitgründer François Chollet äußerte sich zu den Ergebnissen und unterschied zwischen unzulässigen, speziell für den Benchmark gebauten Umgebungen und allgemeinen API-Einstellungen, die allen Nutzern zur Verfügung stehen – letztere seien in Ordnung. Er räumte ein, dass es viel Austausch mit OpenAI gab, wie man deren Modelle testen könne, und warnte vor einem möglichen Vergleichbarkeitsproblem, wenn jeder Anbieter unterschiedliche Einstellungen nutzt, hielt dies aber bei klarer Dokumentation für akzeptabel.