パターンを読み込んでいます…
デュアルLLMとケイパビリティセキュリティ(CaMeL)
エージェントを、信頼できるユーザー指示のみを参照して制御フローとデータフローを計画する特権LLMと、信頼できないコンテンツを処理するが制御フローには一切影響を与えられない隔離LLMに分割する。ケイパビリティを追跡するインタープリターが明示的なデータフローポリシーを強制するため、ツール出力に注入された指示が不正な操作を引き起こすことは決してない。これは確率的なフィルタリングではなく、設計による防御である。
30秒でわかる概要
- 概要
- 制御フローを計画する信頼されたLLMと、データ抽出だけを行う信頼されないLLMを分離し、どのデータがどの操作を起動できるかをケイパビリティタグで強制する。
- 使いどころ
- エージェントが信頼できないユーザー入力やツール出力を処理する場面で、プロンプトインジェクションによって実行経路が変えられたり、制限されたリソースにアクセスされたりするのを防ぐ必要があるとき。
- 注意点
- 実装の複雑さと実行時オーバーヘッドが大きい。ケイパビリティ追跡はレイテンシを増やし、正当なワークフローを壊さないよう慎重なポリシー設計を求める。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
デュアルLLMとケイパビリティセキュリティ(CaMeL): 概要
エージェントを、信頼できるユーザー指示のみを参照して制御フローとデータフローを計画する特権LLMと、信頼できないコンテンツを処理するが制御フローには一切影響を与えられない隔離LLMに分割する。ケイパビリティを追跡するインタープリターが明示的なデータフローポリシーを強制するため、ツール出力に注入された指示が不正な操作を引き起こすことは決してない。これは確率的なフィルタリングではなく、設計による防御である。
- Privileged LLM plans control flow from trusted input only
- Quarantined LLM extracts data from untrusted content, never issues commands
- Capability tags track data provenance through every value
- Interpreter enforces data-flow policies before each tool call
- Injected instructions in tool outputs cannot reach the control path
- Formal security guarantees instead of best-effort prompt filtering
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
あなたのエージェントシステムをレッドチーミング
ここで説明した対策は、誰かが破ろうとして初めて確かめられます。実際の攻撃者と同じ手口で検証します。プロンプトインジェクション、ジェイルブレイク、ツールの悪用、データ持ち出しまで、すべての指摘に修正方法を添えます。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで