Loading...
エージェント型SRE(自己修復運用)(ASRE)
エージェントが外部システムを正常に保つ、クローズドループの運用アーキテクチャ。異常を検知し、想定される根本原因を診断し、ポリシーで制限された修復を実行し、ループを閉じる前に信頼性目標に照らして回復を検証する。通常は、役割ごとに専門化されたチーム(検知担当、診断担当、修復担当、検証担当)として構築され、human-on-the-loopのガバナンスの下で動作する。エンジニアがポリシー、ガードレール、許可されるアクションの集合を定義し、エージェントはその範囲内で実行して報告する。最小権限の付与とpolicy-as-codeにより修復を安全な範囲内に保ち、リスクの高いアクションは人間の承認を必要とする。`predictive-agent-fault-tolerance`とは異なる。あちらはエージェントシステム自体を存続させるものであり、こちらはエージェントが運用する外部システムに対して信頼性の作業を行うものである。
In 30 seconds
- What
- エージェントが異常を検知し、根本原因を診断し、ポリシーの範囲内で修正を実行したうえで、SLO に照らして復旧を検証します。これを人間の監督下でクローズドループとして回します。
- When to use
- 既知の障害パターンから外部システムを自律的に復旧させたい一方で、エージェントが取れる行動の範囲は人間が管理し続けたい場合。
- Watch out
- ポリシーが緩すぎたり検証が弱かったりすると、エージェントが根本原因を直さずに症状を覆い隠したり、障害を連鎖させたりする恐れがあります。
Loading technique guide…