Loading...
Cadre d'évaluation Constitutional AI(CAI-Eval)
Cadre d'Anthropic pour évaluer la sûreté de l'IA à partir de principes constitutionnels, incluant des tests de résistance au jailbreak et une évaluation de l'innocuité.
In 30 seconds
- What
- Teste les sorties de l'IA au regard d'un ensemble de principes explicites, à l'aide de classifieurs et d'adversaires en red team, pour mesurer la résistance au jailbreak et les comportements nuisibles.
- When to use
- Pour construire des systèmes critiques du point de vue de la sûreté, quand il vous faut des preuves chiffrées de résistance aux prompts adverses et des scores d'innocuité mesurables.
- Watch out
- Les tests en red team coûtent cher et prennent du temps ; les résultats peuvent ne pas se transposer à votre contexte de déploiement ni à de nouveaux vecteurs d'attaque.
Loading technique guide…