Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Anthropic arbeitet mit Accenture zusammen, um seine Modelle unabhängig bewerten zu lassen. Die Prüfaufgaben übernimmt Faculty, das auf KI spezialisierte Geschäft von Accenture. Die Prüfer sollen Modelle bewerten, Red-Teaming betreiben, Alignment prüfen und Schutzmechanismen testen. Beide Seiten wollen in den nächsten fünf Jahren jeweils mindestens eine Milliarde Dollar in den Aufbau entsprechender Kapazitäten stecken. Das Konzept der eingebetteten Evaluierung ist neu, viele Details sind laut Anthropic noch offen. Anders als externe Prüfer arbeiten eingebettete Evaluatoren im Unternehmen und erhalten Zugang ähnlich dem eines Angestellten. So können sie Modelle beim Training beobachten, Entscheidungen verfolgen und mit Mitarbeitern sprechen. Sie sollen prüfen, ob das Unternehmen seine Sicherheitszusagen einhält, und Schwachstellen finden. Anthropic betont, die Verantwortung für die Sicherheit seiner Modelle bleibe bei ihm. Standards für Zugang und Kommunikation der Prüfer fehlen noch, ebenso eine feste Finanzierung. Da es beides nicht gibt, finanziert Anthropic Accentures Arbeit direkt und spricht mit METR sowie anderen gemeinnützigen Evaluatoren über Pilotprojekte mit deren eigener Finanzierung. Die Partnerschaft ist nicht exklusiv. Weitere Prüfer will Anthropic in den kommenden Wochen nennen. Die Quellen berichten weitgehend übereinstimmend.