Im Quellenvergleich

MWS AI Vision Bench Erweiterung

1 Quellen · 2 Meldungen · Stand 08.10.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Der MWS AI Vision Bench ist ein offener Benchmark zur Bewertung multimodaler Modelle auf russischsprachigen Dokumenten und wurde um die Kategorie Anti-fraud erweitert. Diese prüft, ob eine universelle multimodale LLM gefälschte oder generierte Dokumente erkennt und begründen kann. Der Datensatz umfasst 430 Bilder in drei Klassen: 200 als unverändert geltende Originale, 130 manuelle Bearbeitungen in Grafikprogrammen und 100 vollständig generativ erzeugte Dokumente. Er steht unter einer Research-only-Lizenz. Die Bewertung kombiniert eine um Zufallsniveau bereinigte balanced accuracy mit einem Erklärungspunkt für manuell bearbeitete Dokumente; für generierte Dokumente gibt es keine solche Referenzliste. Claude Opus 5.5 führt die Anti-fraud-Liste an, GPT-6.1 Sol liegt trotz Platz eins im Overall nur auf Rang drei. Die Korrelation zwischen Anti-fraud und Overall liegt bei etwa 0,64 auf Validation und 0,53 auf Test. Anti-fraud bleibt eine separate Spalte. Zudem wurden 395 von 400 VQA-Aufgaben präzisiert, wodurch alte und neue Ergebnisse nicht direkt vergleichbar sind. Der Autor sieht VQA und einfache OCR-Aufgaben nahe der Sättigung und nennt Kostenbeispiele: GPT-6 Luna erreicht 0,770 für unter einem Dollar, GPT-6.1 Sol 0,822 für rund 12 Dollar, Claude Opus 5.5 0,819 für etwa 27 Dollar. Die Quellen berichten weitgehend übereinstimmend.

Worin sie sich unterscheidenBegründung, warum Anti-fraud eine separate Spalte bleibt
Begründung, warum Anti-fraud eine separate Spalte bleibt
  • Anti-fraud bleibt eine separate Spalte, weil die Daten teils den Antwortweg verraten und echte Dokumente aus Rechtsgründen fehlen.1

Quellen (1)

Vollständige Übersicht mit allen Meldungen öffnen →