Loading...
Constitutional AI 評価フレームワーク(CAI-Eval)
憲章的な原則に基づいて AI の安全性を評価する Anthropic のフレームワーク。ジェイルブレイク耐性のテストや無害性の評価を含みます。
In 30 seconds
- What
- 分類器とレッドチームの攻撃役を使って AI の出力を明示された原則の集合に照らして検証し、ジェイルブレイク耐性と有害な振る舞いを測定します。
- When to use
- 敵対的なプロンプトへの耐性を数値で示す証拠と、測定可能な無害性スコアが必要な安全性クリティカルなシステムを構築するとき。
- Watch out
- レッドチームによるテストは費用も時間もかかり、その結果があなた固有の運用状況や未知の攻撃手口にそのまま当てはまるとは限りません。
Loading technique guide…