Im Quellenvergleich

KI-Benchmarks Vertrauensproblem

2 Quellen · 2 Meldungen · Stand 28.08.2026

Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.

Im Quellenvergleich

Worin die Quellen übereinstimmen

Google DeepMind führt die weltweit erste doppelblinde Evaluierung eines eigenen KI-Modells ein. Das Verfahren soll Benchmark-Kontamination verhindern, bei der ein Modell Testfragen bereits aus dem Training kennt und die Ergebnisse dadurch verfälscht werden. Externe Bewertungen werden in einer kryptografischen „Box“ gehalten, sodass Modelle sie vor dem Test nicht nutzen können. Getestet wird ein Modell der Reihe Gemini Flash Lite. Partner sind das Singapore AI Safety Institute, OpenMined, AVERI und MLCommons. Die Methode nutzt „Confidential Space“ aus dem Cloud-Computing-Portfolio von Google Cloud. Die Quellen berichten weitgehend übereinstimmend.

Worin sie sich unterscheidenZweck und Anwendungsbereich der neuen Methode
Zweck und Anwendungsbereich der neuen Methode
  • Die neuen technischen und kryptografischen Sicherungen seien ein Fortschritt gegenüber bisherigen Protokollen ohne Protokollierung und vertraglichen Vereinbarungen.1
  • Die Methode sei besonders wichtig bei sensiblen Evaluierungen, etwa in der Cybersicherheit oder bei Tests durch staatliche Stellen.2

Quellen (2)

Vollständige Übersicht mit allen Meldungen öffnen →