Im Quellenvergleich
Worin die Quellen übereinstimmen
Mistral hat mit Shieldstral einen KI-Sicherheitsklassifikator mit offenen Gewichten veröffentlicht. Das Modell hat 3 Milliarden Parameter und bewertet Inhalte auf Sicherheit. Es ist unter der Apache-2.0-Lizenz verfügbar. Shieldstral arbeitet nicht mit festen Schadenskategorien, sondern erhält die zu prüfende Richtlinie als Frage in natürlicher Sprache zur Laufzeit. Das Modell gibt einen kalibrierten Sicherheitswert zwischen null und eins aus. Es bewertet Text und Bilder mit derselben Oberfläche. Die Quellen berichten weitgehend übereinstimmend.
Worin sie sich unterscheidenLeistungsvergleich mit größeren Modellen·Antwortformat des Modells·Konkrete Benchmark-Ergebnisse+2 weitere
Leistungsvergleich mit größeren Modellen- Das Modell übertrifft Modelle, die bis zu siebenmal größer sind.1
- Auf gängigen Sicherheitsbenchmarks für Text erreicht es die Leistung von dreimal größeren Modellen.2
Antwortformat des Modells- Das Modell gibt einen kalibrierten Sicherheitswert aus.1
- Das Modell antwortet nur mit 'yes' oder 'no'; aus den Wahrscheinlichkeiten beider Antworten errechnet das System den Sicherheitswert.2
Konkrete Benchmark-Ergebnisse- Auf den kombinierten Textbenchmarks erreicht Shieldstral einen F1-Wert von 84,9 Prozent und liegt damit gleichauf mit dem etwa siebenmal größeren GPT-OSS-Safeguard-20B von OpenAI.2
- Bei Bildern und Bild-Text-Kombinationen kommt das Modell auf 83,8 Prozent und übertrifft OmniGuard-7B (77,6) sowie LlavaGuard-7B (71,6).2
- Beim Anpassungsbenchmark mit abweichenden oder völlig neuen Regeln führt GPT-OSS-Safeguard-20B mit 94,1 Prozent vor Shieldstral (91,3).2
Bewertung der Praktikabilität- Die Autoren halten ihr Modell für praktikabler, weil die Konkurrenz vor der Antwort lange Zwischenschritte erzeugt und damit die Rechenkosten erhöht; Shieldstral gibt nur ein einziges Wort aus.2
Trainingsdaten- Die Entwickler trainierten das Modell auf echten und synthetischen Daten mit unterschiedlichen Formaten.1
- Die Forscher führten rund 54,1 Millionen Beispiele aus verschiedenen Datensätzen in einem einheitlichen Format zusammen.2