正在加载模式…
智能体化 SRE(自愈运维)(ASRE)
一种闭环运维架构,其中智能体负责保持外部系统的健康:检测异常、诊断可能的根本原因、执行受策略约束的修复,然后在闭合回路之前对照可靠性目标验证恢复情况。它通常构建为一支角色专门化的团队(检测者、诊断者、修复者、验证者),在人在回路之上(human-on-the-loop)的治理下运行,由工程师定义策略、护栏和允许的动作集合,而智能体在这些边界内执行并汇报。最小权限授权和策略即代码(policy-as-code)将修复保持在安全范围内,风险较高的动作则需人工审批。与 `predictive-agent-fault-tolerance` 不同:后者维持智能体系统自身的存活,而本模式是智能体对其所运维的外部系统开展可靠性工作。
30秒速览
- 是什么
- 智能体检测异常、诊断根因、在策略约束内执行修复,然后对照 SLO 验证是否恢复,整个过程在人工监督下形成闭环。
- 何时使用
- 外部系统需要从已知故障模式中自主恢复,同时由人类掌控智能体可以采取哪些操作。
- 注意
- 策略过于宽松或验证过于薄弱,会导致智能体只是掩盖症状而非修复根因,甚至引发级联故障。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
智能体化 SRE(自愈运维): 概览
一种闭环运维架构,其中智能体负责保持外部系统的健康:检测异常、诊断可能的根本原因、执行受策略约束的修复,然后在闭合回路之前对照可靠性目标验证恢复情况。它通常构建为一支角色专门化的团队(检测者、诊断者、修复者、验证者),在人在回路之上(human-on-the-loop)的治理下运行,由工程师定义策略、护栏和允许的动作集合,而智能体在这些边界内执行并汇报。最小权限授权和策略即代码(policy-as-code)将修复保持在安全范围内,风险较高的动作则需人工审批。与 `predictive-agent-fault-tolerance` 不同:后者维持智能体系统自身的存活,而本模式是智能体对其所运维的外部系统开展可靠性工作。
- Closed loop: detect, diagnose, remediate, verify
- Role-specialized team: detector, diagnoser, remediator, verifier
- Policy-bounded autonomy with a least-privilege set of allowed actions
- Human-on-the-loop: engineers set policy, agents execute and report
- Recovery verified against SLOs before an incident is closed
- Automatic rollback and generated incident reports for audit
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前