正在加载模式…
爆炸半径遏制与自主性边界(BRC)
在行为发生之前就限制失控智能体的最坏情况影响,而不仅仅是在事后检测滥用。工具按可逆性和影响进行分类(读取无需限制,写入需经验证,破坏性操作会被暂停);权限按任务以最小权限原则限定范围;自主性是逐级授予的(从辅助,到提议并审批,到执行并审计,再到观察),并随着可靠性得到验证而逐步获得;不可逆的步骤会触发试运行或计划预览,让人类审查计划而非其后果;带有状态捕获与隔离功能的紧急停止开关可以在运行中途中止智能体。它与人在回路不同:后者是一种监督立场,而它是按可逆性来限定能力。它与智能体沙箱隔离不同:后者隔离执行环境,而它按每个工具的可逆性进行分级并逐级放开自主性。它与工具滥用防护不同:后者防御的是注入驱动的滥用,而非爆炸半径的分类。
30秒速览
- 是什么
- 按可逆性(读取、写入、破坏性)对工具分类,为每个任务授予最小权限,随着可靠性得到验证逐步放开自主权,并在执行前以试运行方式呈现不可逆动作供人审阅。
- 何时使用
- 在智能体一旦出错就会造成真实损害的高风险系统中(数据库、基础设施、支付),并且你需要在智能体动手之前就限定最坏情况的影响范围。
- 注意
- 为每个工具分类并管理分级自主权的开销会拖慢上线速度;而对可逆性分类过度自信,则会让人低估真正的影响半径。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
爆炸半径遏制与自主性边界: 概览
在行为发生之前就限制失控智能体的最坏情况影响,而不仅仅是在事后检测滥用。工具按可逆性和影响进行分类(读取无需限制,写入需经验证,破坏性操作会被暂停);权限按任务以最小权限原则限定范围;自主性是逐级授予的(从辅助,到提议并审批,到执行并审计,再到观察),并随着可靠性得到验证而逐步获得;不可逆的步骤会触发试运行或计划预览,让人类审查计划而非其后果;带有状态捕获与隔离功能的紧急停止开关可以在运行中途中止智能体。它与人在回路不同:后者是一种监督立场,而它是按可逆性来限定能力。它与智能体沙箱隔离不同:后者隔离执行环境,而它按每个工具的可逆性进行分级并逐级放开自主性。它与工具滥用防护不同:后者防御的是注入驱动的滥用,而非爆炸半径的分类。
- Tools classified by reversibility and impact (read free, write validated, destructive paused)
- Least-privilege tool scoping granted per task
- Graduated autonomy levels earned as reliability is proven
- Dry-run and plan-preview before irreversible actions
- Kill switch with state capture and quarantine
- Worst-case impact bounded before the agent acts, not after
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
对你的智能体系统做红队测试
这里写的防护,只有真的有人去攻破才算数。我们用真实攻击者的方式测试你的系统:提示注入、越狱、工具滥用与数据外泄,每一条结论都附上修复方案。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前