Chargement des modèles…
Cadre d'évaluation Constitutional AI(CAI-Eval)
Cadre d'Anthropic pour évaluer la sûreté de l'IA à partir de principes constitutionnels, incluant des tests de résistance au jailbreak et une évaluation de l'innocuité.
Aperçu en 30 secondes
- Quoi
- Teste les sorties de l'IA au regard d'un ensemble de principes explicites, à l'aide de classifieurs et d'adversaires en red team, pour mesurer la résistance au jailbreak et les comportements nuisibles.
- Quand l'utiliser
- Pour construire des systèmes critiques du point de vue de la sûreté, quand il vous faut des preuves chiffrées de résistance aux prompts adverses et des scores d'innocuité mesurables.
- Vigilance
- Les tests en red team coûtent cher et prennent du temps ; les résultats peuvent ne pas se transposer à votre contexte de déploiement ni à de nouveaux vecteurs d'attaque.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Cadre d'évaluation Constitutional AI: Vue d’ensemble
Cadre d'Anthropic pour évaluer la sûreté de l'IA à partir de principes constitutionnels, incluant des tests de résistance au jailbreak et une évaluation de l'innocuité.
- Constitutional principle adherence testing
- Jailbreak resistance evaluation (95%+ success rate)
- Red team adversarial assessment
- Harmlessness from AI feedback
- Constitutional classifiers validation
- 3000+ hours of red team testing
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
- Constitutional AI: Harmlessness from AI Feedback - Anthropic (2022)
- Constitutional Classifiers: Defending against universal jailbreaks - Anthropic (2025)
- Progress from our Frontier Red Team - Anthropic (2024)
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre