Загружаем паттерны…
Агентная SRE (самовосстанавливающиеся операции)(ASRE)
Архитектура эксплуатации с замкнутым контуром, в которой агенты поддерживают работоспособность внешней системы: обнаруживают аномалию, диагностируют вероятную первопричину, выполняют ограниченное политиками устранение, а затем проверяют восстановление по целевым показателям надёжности, прежде чем замкнуть контур. Обычно строится как команда со специализированными ролями (детектор, диагност, устранитель, верификатор), работающая под управлением по принципу human-on-the-loop, где инженеры определяют политики, ограничители и набор разрешённых действий, а агенты действуют в этих рамках и отчитываются. Права по принципу наименьших привилегий и policy-as-code удерживают устранение в безопасных пределах, а более рискованные действия требуют одобрения человека. Отличается от `predictive-agent-fault-tolerance`: тот поддерживает жизнеспособность самой системы агентов, тогда как здесь агенты выполняют работу по обеспечению надёжности внешних систем, которыми управляют.
За 30 секунд
- Что это
- Агенты обнаруживают аномалии, диагностируют первопричины, выполняют ограниченные политиками исправления и затем проверяют восстановление по SLO, замыкая цикл под контролем человека.
- Когда применять
- Внешние системы должны автономно восстанавливаться после известных сбоев, но при этом люди сохраняют контроль над тем, какие действия разрешены агентам.
- Осторожно
- Слишком разрешительные политики или слабая проверка приводят к тому, что агенты маскируют симптомы вместо устранения первопричин или запускают каскадные отказы.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Агентная SRE (самовосстанавливающиеся операции): Обзор
Архитектура эксплуатации с замкнутым контуром, в которой агенты поддерживают работоспособность внешней системы: обнаруживают аномалию, диагностируют вероятную первопричину, выполняют ограниченное политиками устранение, а затем проверяют восстановление по целевым показателям надёжности, прежде чем замкнуть контур. Обычно строится как команда со специализированными ролями (детектор, диагност, устранитель, верификатор), работающая под управлением по принципу human-on-the-loop, где инженеры определяют политики, ограничители и набор разрешённых действий, а агенты действуют в этих рамках и отчитываются. Права по принципу наименьших привилегий и policy-as-code удерживают устранение в безопасных пределах, а более рискованные действия требуют одобрения человека. Отличается от `predictive-agent-fault-tolerance`: тот поддерживает жизнеспособность самой системы агентов, тогда как здесь агенты выполняют работу по обеспечению надёжности внешних систем, которыми управляют.
- Closed loop: detect, diagnose, remediate, verify
- Role-specialized team: detector, diagnoser, remediator, verifier
- Policy-bounded autonomy with a least-privilege set of allowed actions
- Human-on-the-loop: engineers set policy, agents execute and report
- Recovery verified against SLOs before an incident is closed
- Automatic rollback and generated incident reports for audit
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Проведите ревью архитектуры ваших агентов
На этой странице описан один паттерн. Ваша система использует десятки, и большинство сбоев возникает на стыках. Мы разберём весь дизайн по 288 паттернам каталога: архитектура, надёжность, оценка и стоимость, каждая находка связана с паттерном, который её устраняет.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября