Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Der MWS AI Vision Bench ist ein offener Benchmark zur Bewertung multimodaler Modelle auf russischsprachigen Dokumenten und wurde um die Kategorie Anti-fraud erweitert. Diese prüft, ob eine universelle multimodale LLM gefälschte oder generierte Dokumente erkennt und begründen kann. Der Datensatz umfasst 430 Bilder in drei Klassen: 200 als unverändert geltende Originale, 130 manuelle Bearbeitungen in Grafikprogrammen und 100 vollständig generativ erzeugte Dokumente. Er steht unter einer Research-only-Lizenz. Die Bewertung kombiniert eine um Zufallsniveau bereinigte balanced accuracy mit einem Erklärungspunkt für manuell bearbeitete Dokumente; für generierte Dokumente gibt es keine solche Referenzliste. Claude Opus 5.5 führt die Anti-fraud-Liste an, GPT-6.1 Sol liegt trotz Platz eins im Overall nur auf Rang drei. Die Korrelation zwischen Anti-fraud und Overall liegt bei etwa 0,64 auf Validation und 0,53 auf Test. Anti-fraud bleibt eine separate Spalte. Zudem wurden 395 von 400 VQA-Aufgaben präzisiert, wodurch alte und neue Ergebnisse nicht direkt vergleichbar sind. Der Autor sieht VQA und einfache OCR-Aufgaben nahe der Sättigung und nennt Kostenbeispiele: GPT-6 Luna erreicht 0,770 für unter einem Dollar, GPT-6.1 Sol 0,822 für rund 12 Dollar, Claude Opus 5.5 0,819 für etwa 27 Dollar. Die Quellen berichten weitgehend übereinstimmend.