Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Google DeepMind führt die weltweit erste doppelblinde Evaluierung eines eigenen KI-Modells ein. Das Verfahren soll Benchmark-Kontamination verhindern, bei der ein Modell Testfragen bereits aus dem Training kennt und die Ergebnisse dadurch verfälscht werden. Externe Bewertungen werden in einer kryptografischen „Box“ gehalten, sodass Modelle sie vor dem Test nicht nutzen können. Getestet wird ein Modell der Reihe Gemini Flash Lite. Partner sind das Singapore AI Safety Institute, OpenMined, AVERI und MLCommons. Die Methode nutzt „Confidential Space“ aus dem Cloud-Computing-Portfolio von Google Cloud. Die Quellen berichten weitgehend übereinstimmend.