Loading...
Constitutional AI Evaluierungs-Framework(CAI-Eval)
Anthropics Framework zur Bewertung der KI-Sicherheit anhand konstitutioneller Prinzipien, einschließlich Tests der Jailbreak-Resistenz und einer Bewertung der Harmlosigkeit.
In 30 seconds
- What
- Prüft KI-Ausgaben anhand einer Sammlung expliziter Prinzipien und misst mit Klassifikatoren und Red-Team-Angreifern die Widerstandsfähigkeit gegen Jailbreaks sowie schädliches Verhalten.
- When to use
- Beim Bau sicherheitskritischer Systeme, wenn Sie belastbare Zahlen zur Widerstandsfähigkeit gegen adversariale Prompts und messbare Harmlosigkeitswerte brauchen.
- Watch out
- Red-Team-Tests sind teuer und zeitaufwendig; die Ergebnisse lassen sich womöglich nicht auf Ihren konkreten Einsatzkontext oder neuartige Angriffsvektoren übertragen.
Loading technique guide…