Loading...
💥
爆炸半径遏制与自主性边界(BRC)
在行为发生之前就限制失控智能体的最坏情况影响,而不仅仅是在事后检测滥用。工具按可逆性和影响进行分类(读取无需限制,写入需经验证,破坏性操作会被暂停);权限按任务以最小权限原则限定范围;自主性是逐级授予的(从辅助,到提议并审批,到执行并审计,再到观察),并随着可靠性得到验证而逐步获得;不可逆的步骤会触发试运行或计划预览,让人类审查计划而非其后果;带有状态捕获与隔离功能的紧急停止开关可以在运行中途中止智能体。它与人在回路不同:后者是一种监督立场,而它是按可逆性来限定能力。它与智能体沙箱隔离不同:后者隔离执行环境,而它按每个工具的可逆性进行分级并逐级放开自主性。它与工具滥用防护不同:后者防御的是注入驱动的滥用,而非爆炸半径的分类。
复杂度: high安全与隐私模式
In 30 seconds
- What
- 按可逆性(读取、写入、破坏性)对工具分类,为每个任务授予最小权限,随着可靠性得到验证逐步放开自主权,并在执行前以试运行方式呈现不可逆动作供人审阅。
- When to use
- 在智能体一旦出错就会造成真实损害的高风险系统中(数据库、基础设施、支付),并且你需要在智能体动手之前就限定最坏情况的影响范围。
- Watch out
- 为每个工具分类并管理分级自主权的开销会拖慢上线速度;而对可逆性分类过度自信,则会让人低估真正的影响半径。
Loading technique guide…