パターンを読み込んでいます…
Constitutional AI 評価フレームワーク(CAI-Eval)
憲章的な原則に基づいて AI の安全性を評価する Anthropic のフレームワーク。ジェイルブレイク耐性のテストや無害性の評価を含みます。
30秒でわかる概要
- 概要
- 分類器とレッドチームの攻撃役を使って AI の出力を明示された原則の集合に照らして検証し、ジェイルブレイク耐性と有害な振る舞いを測定します。
- 使いどころ
- 敵対的なプロンプトへの耐性を数値で示す証拠と、測定可能な無害性スコアが必要な安全性クリティカルなシステムを構築するとき。
- 注意点
- レッドチームによるテストは費用も時間もかかり、その結果があなた固有の運用状況や未知の攻撃手口にそのまま当てはまるとは限りません。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
Constitutional AI 評価フレームワーク: 概要
憲章的な原則に基づいて AI の安全性を評価する Anthropic のフレームワーク。ジェイルブレイク耐性のテストや無害性の評価を含みます。
- Constitutional principle adherence testing
- Jailbreak resistance evaluation (95%+ success rate)
- Red team adversarial assessment
- Harmlessness from AI feedback
- Constitutional classifiers validation
- 3000+ hours of red team testing
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- Constitutional AI: Harmlessness from AI Feedback - Anthropic (2022)
- Constitutional Classifiers: Defending against universal jailbreaks - Anthropic (2025)
- Progress from our Frontier Red Team - Anthropic (2024)
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで