パターンを読み込んでいます…
ブラスト半径の封じ込めと自律性の境界(BRC)
誤作動するエージェントの最悪ケースの影響を、事後に不正利用を検知するだけでなく、行動する前に制限する。ツールは可逆性と影響度で分類される(読み取りは自由、書き込みは検証され、破壊的な操作は一時停止される)。権限はタスクごとに最小権限で範囲を限定される。自律性は段階的に付与され(支援から、提案と承認、実行と監査、観察へ)、信頼性が実証されるにつれて獲得される。不可逆的なステップではドライランや計画プレビューが提示され、人間が結果ではなく計画をレビューできる。状態のキャプチャと隔離を備えたキルスイッチにより、実行の途中でエージェントを停止できる。ヒューマン・イン・ザ・ループとは異なる。あちらは監督の姿勢であるのに対し、こちらは可逆性によって能力を制限する。エージェントのサンドボックス化とも異なる。あちらは実行環境を隔離するが、こちらはツールごとの可逆性を階層化し自律性を段階づける。ツール誤用の防止とも異なる。あちらはインジェクションによる誤用を防ぐものであり、ブラスト半径の分類ではない。
30秒でわかる概要
- 概要
- ツールを可逆性(読み取り、書き込み、破壊的)で分類し、タスクごとに最小権限を与え、信頼性が実証されるにつれて自律性を段階的に広げ、不可逆な操作は実行前にドライランとして提示してレビューさせます。
- 使いどころ
- エージェントのミスが実害につながる重要度の高いシステム(データベース、インフラ、決済など)で、エージェントが動く前に最悪の場合の影響を抑え込む必要がある場合。
- 注意点
- すべてのツールを分類し、段階的な自律レベルを管理する手間が導入を遅らせることがあります。また、可逆性の分類を過信すると、影響範囲を見誤ります。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
ブラスト半径の封じ込めと自律性の境界: 概要
誤作動するエージェントの最悪ケースの影響を、事後に不正利用を検知するだけでなく、行動する前に制限する。ツールは可逆性と影響度で分類される(読み取りは自由、書き込みは検証され、破壊的な操作は一時停止される)。権限はタスクごとに最小権限で範囲を限定される。自律性は段階的に付与され(支援から、提案と承認、実行と監査、観察へ)、信頼性が実証されるにつれて獲得される。不可逆的なステップではドライランや計画プレビューが提示され、人間が結果ではなく計画をレビューできる。状態のキャプチャと隔離を備えたキルスイッチにより、実行の途中でエージェントを停止できる。ヒューマン・イン・ザ・ループとは異なる。あちらは監督の姿勢であるのに対し、こちらは可逆性によって能力を制限する。エージェントのサンドボックス化とも異なる。あちらは実行環境を隔離するが、こちらはツールごとの可逆性を階層化し自律性を段階づける。ツール誤用の防止とも異なる。あちらはインジェクションによる誤用を防ぐものであり、ブラスト半径の分類ではない。
- Tools classified by reversibility and impact (read free, write validated, destructive paused)
- Least-privilege tool scoping granted per task
- Graduated autonomy levels earned as reliability is proven
- Dry-run and plan-preview before irreversible actions
- Kill switch with state capture and quarantine
- Worst-case impact bounded before the agent acts, not after
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
あなたのエージェントシステムをレッドチーミング
ここで説明した対策は、誰かが破ろうとして初めて確かめられます。実際の攻撃者と同じ手口で検証します。プロンプトインジェクション、ジェイルブレイク、ツールの悪用、データ持ち出しまで、すべての指摘に修正方法を添えます。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで