Im Quellenvergleich
Alle Inhalte werden von KI erstellt. Dieser Überblick fasst zusammen, worin sich mehrere Quellen einig sind und worin sie sich unterscheiden — die Bewertung bleibt dir überlassen.
Der Artikel beschreibt das GuardRate Tool und das GuardRate Leaderboard zur Bewertung von Guardrail-Modellen. Die Evaluation ist als automatisierte Pipeline im Sinne von Evaluation-as-Code aufgebaut: Modelle laufen isoliert in Docker-Umgebungen mit vLLM statt über Cloud-APIs, gestartet per CLI mit YAML-Konfiguration. Die Pipeline umfasst Modellstart, Datenvorbereitung, Inferenz über eine OpenAI-kompatible API, Parsing der Antworten in die Labels harm/safe, Berechnung von Metriken (F1, FNR, FPR, Precision, Recall, Accuracy), Aggregation und Veröffentlichung in einen Hugging-Face-Bucket. Die Sammlung umfasst 19 Benchmarks, ausgewählt nach Kriterien wie Zitierungen, Sprachabdeckung und Kategorienvielfalt und geordnet in Cluster wie Over-Refusal, Prompt-Angriffe, allgemeine Sicherheit sowie russischsprachige und mehrsprachige Tests. Alle Läufe erfolgten auf einer NVIDIA A100 mit 80 GB VRAM, festem Random Seed, batch_size=1 und max_length 512. Die Bewertung stützt sich auf FPR und FNR statt auf F1 und Accuracy. Daraus werden drei Ebenen gebildet: Dataset Score, Group Score (harmonisches Mittel) und Integral Score (geometrisches Mittel über die Gruppen). Das geometrische Mittel bestraft Ungleichgewicht hart. Der Text nennt eine blinde Zone: Bei einem Ausreißer von 0.50 liegt der Group Score bei 0.7820 und der Integral Score bei 0.8022, eine Differenz von −0.0202. Deshalb wird zusätzlich die minimale Bewertung je Datensatz veröffentlicht. Beim Sing-Guard liegt die 2B-Version auf Platz 2, die 4B-Version auf Platz 19, weil die 4B-Version nur bei OR-Bench (+0.25) gewinnt, aber bei SimpleSafetyTests und MultiJail verliert und einen höheren FNR hat (0.31 gegen 0.17). Beim HaloGuard ist die 4B-Version die gleichmäßigste im Top-Bereich (min_group = 0.509), während Qwen-8B bei ähnlichem Integral eine schlechteste Gruppe von 0.108 hat. Der Spitzenreiter YuFeng-XGuard-Reason-8B schneidet bei russischen toxischen Antworten schlecht ab (Dataset Score auf RTP-LX 0.051, Qwen-8B 0.031, HaloGuard 0.53). Llama-Guard-4-12B (Platz 20, 0.631) liegt hinter Llama-Guard-3-8B (Platz 17, 0.663).