パターンを読み込んでいます…
エージェント型SRE(自己修復運用)(ASRE)
エージェントが外部システムを正常に保つ、クローズドループの運用アーキテクチャ。異常を検知し、想定される根本原因を診断し、ポリシーで制限された修復を実行し、ループを閉じる前に信頼性目標に照らして回復を検証する。通常は、役割ごとに専門化されたチーム(検知担当、診断担当、修復担当、検証担当)として構築され、human-on-the-loopのガバナンスの下で動作する。エンジニアがポリシー、ガードレール、許可されるアクションの集合を定義し、エージェントはその範囲内で実行して報告する。最小権限の付与とpolicy-as-codeにより修復を安全な範囲内に保ち、リスクの高いアクションは人間の承認を必要とする。`predictive-agent-fault-tolerance`とは異なる。あちらはエージェントシステム自体を存続させるものであり、こちらはエージェントが運用する外部システムに対して信頼性の作業を行うものである。
30秒でわかる概要
- 概要
- エージェントが異常を検知し、根本原因を診断し、ポリシーの範囲内で修正を実行したうえで、SLO に照らして復旧を検証します。これを人間の監督下でクローズドループとして回します。
- 使いどころ
- 既知の障害パターンから外部システムを自律的に復旧させたい一方で、エージェントが取れる行動の範囲は人間が管理し続けたい場合。
- 注意点
- ポリシーが緩すぎたり検証が弱かったりすると、エージェントが根本原因を直さずに症状を覆い隠したり、障害を連鎖させたりする恐れがあります。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
エージェント型SRE(自己修復運用): 概要
エージェントが外部システムを正常に保つ、クローズドループの運用アーキテクチャ。異常を検知し、想定される根本原因を診断し、ポリシーで制限された修復を実行し、ループを閉じる前に信頼性目標に照らして回復を検証する。通常は、役割ごとに専門化されたチーム(検知担当、診断担当、修復担当、検証担当)として構築され、human-on-the-loopのガバナンスの下で動作する。エンジニアがポリシー、ガードレール、許可されるアクションの集合を定義し、エージェントはその範囲内で実行して報告する。最小権限の付与とpolicy-as-codeにより修復を安全な範囲内に保ち、リスクの高いアクションは人間の承認を必要とする。`predictive-agent-fault-tolerance`とは異なる。あちらはエージェントシステム自体を存続させるものであり、こちらはエージェントが運用する外部システムに対して信頼性の作業を行うものである。
- Closed loop: detect, diagnose, remediate, verify
- Role-specialized team: detector, diagnoser, remediator, verifier
- Policy-bounded autonomy with a least-privilege set of allowed actions
- Human-on-the-loop: engineers set policy, agents execute and report
- Recovery verified against SLOs before an incident is closed
- Automatic rollback and generated incident reports for audit
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで