Loading...
ブラスト半径の封じ込めと自律性の境界(BRC)
誤作動するエージェントの最悪ケースの影響を、事後に不正利用を検知するだけでなく、行動する前に制限する。ツールは可逆性と影響度で分類される(読み取りは自由、書き込みは検証され、破壊的な操作は一時停止される)。権限はタスクごとに最小権限で範囲を限定される。自律性は段階的に付与され(支援から、提案と承認、実行と監査、観察へ)、信頼性が実証されるにつれて獲得される。不可逆的なステップではドライランや計画プレビューが提示され、人間が結果ではなく計画をレビューできる。状態のキャプチャと隔離を備えたキルスイッチにより、実行の途中でエージェントを停止できる。ヒューマン・イン・ザ・ループとは異なる。あちらは監督の姿勢であるのに対し、こちらは可逆性によって能力を制限する。エージェントのサンドボックス化とも異なる。あちらは実行環境を隔離するが、こちらはツールごとの可逆性を階層化し自律性を段階づける。ツール誤用の防止とも異なる。あちらはインジェクションによる誤用を防ぐものであり、ブラスト半径の分類ではない。
In 30 seconds
- What
- ツールを可逆性(読み取り、書き込み、破壊的)で分類し、タスクごとに最小権限を与え、信頼性が実証されるにつれて自律性を段階的に広げ、不可逆な操作は実行前にドライランとして提示してレビューさせます。
- When to use
- エージェントのミスが実害につながる重要度の高いシステム(データベース、インフラ、決済など)で、エージェントが動く前に最悪の場合の影響を抑え込む必要がある場合。
- Watch out
- すべてのツールを分類し、段階的な自律レベルを管理する手間が導入を遅らせることがあります。また、可逆性の分類を過信すると、影響範囲を見誤ります。
Loading technique guide…