パターンを読み込んでいます…
憲章分類器(CC)
許可・ブロックするコンテンツを定義する自然言語の憲章から生成された合成データで訓練された、軽量な入力・出力分類器。カスケード構成になっており、安価なスクリーニングがすべてのトラフィックをカバーしつつ、疑わしいケースはエスカレーションされる。出力分類器は、違反トークンが現れた瞬間にストリーミング生成を停止できる。これはConstitutional AIとは異なる。Constitutional AIは訓練中にモデルを整合させるが、憲章分類器は憲章から訓練された実行時のガードである。
30秒でわかる概要
- 概要
- 自然言語で書かれた憲法から生成した合成データで軽量な分類器を訓練し、推論前に入力を検査して、違反した最初のトークンで出力を打ち切ります。
- 使いどころ
- 憲法のルールが明確で、攻撃パターンを訓練用に合成できる場合に、実行時のコンテンツフィルタリングを必要とする大量処理システムで。
- 注意点
- 合成データで訓練した分類器は、憲法から生成した例に含まれていない新種の難読化や敵対的な言い回しを見逃すおそれがあります。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
憲章分類器: 概要
許可・ブロックするコンテンツを定義する自然言語の憲章から生成された合成データで訓練された、軽量な入力・出力分類器。カスケード構成になっており、安価なスクリーニングがすべてのトラフィックをカバーしつつ、疑わしいケースはエスカレーションされる。出力分類器は、違反トークンが現れた瞬間にストリーミング生成を停止できる。これはConstitutional AIとは異なる。Constitutional AIは訓練中にモデルを整合させるが、憲章分類器は憲章から訓練された実行時のガードである。
- Constitution in natural language defines allowed vs blocked content
- Synthetic training data generated from the constitution
- Input classifier screens prompts before the model runs
- Streaming output classifier halts generation at first violating token
- Cascaded cheap-to-expensive screening controls cost
- Constitution can be updated as new attack classes emerge
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
あなたのエージェントシステムをレッドチーミング
ここで説明した対策は、誰かが破ろうとして初めて確かめられます。実際の攻撃者と同じ手口で検証します。プロンプトインジェクション、ジェイルブレイク、ツールの悪用、データ持ち出しまで、すべての指摘に修正方法を添えます。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで