Загружаем паттерны…
Ограничение радиуса поражения и границы автономии(BRC)
Ограничивает наихудшее возможное воздействие сбойного агента до того, как он начнёт действовать, а не только выявляет злоупотребления постфактум. Инструменты классифицируются по обратимости и воздействию (чтение свободно, запись валидируется, деструктивные операции ставятся на паузу); полномочия ограничиваются по принципу наименьших привилегий для каждой задачи; автономия предоставляется поэтапно (от помощи к предложению-и-одобрению, затем к действию-и-аудиту и к наблюдению) и заслуживается по мере подтверждения надёжности; необратимые шаги вызывают пробный прогон или предпросмотр плана, чтобы человек проверял план, а не его последствия; а аварийный выключатель с захватом состояния и помещением в карантин может остановить агента посреди выполнения. Отличается от человека в контуре: это позиция надзора, тогда как здесь возможности ограничиваются по обратимости. Отличается от песочницы для агентов: она изолирует среду выполнения, тогда как здесь ранжируется обратимость по каждому инструменту и поэтапно расширяется автономия. Отличается от предотвращения злоупотребления инструментами: оно защищает от злоупотреблений, вызванных инъекцией, а не от классификации радиуса поражения.
За 30 секунд
- Что это
- Классифицирует инструменты по обратимости (чтение, запись, разрушающие), выдаёт минимальные права на каждую задачу, постепенно расширяет автономию по мере подтверждения надёжности и показывает необратимые действия в режиме пробного прогона перед выполнением.
- Когда применять
- Системы с высокой ценой ошибки, где промах агента наносит реальный ущерб (базы данных, инфраструктура, платежи) и нужно ограничить худший сценарий до того, как агент начнёт действовать.
- Осторожно
- Затраты на классификацию каждого инструмента и управление ступенями автономии могут замедлить внедрение, а излишняя вера в классификацию обратимости ведёт к недооценке радиуса поражения.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Ограничение радиуса поражения и границы автономии: Обзор
Ограничивает наихудшее возможное воздействие сбойного агента до того, как он начнёт действовать, а не только выявляет злоупотребления постфактум. Инструменты классифицируются по обратимости и воздействию (чтение свободно, запись валидируется, деструктивные операции ставятся на паузу); полномочия ограничиваются по принципу наименьших привилегий для каждой задачи; автономия предоставляется поэтапно (от помощи к предложению-и-одобрению, затем к действию-и-аудиту и к наблюдению) и заслуживается по мере подтверждения надёжности; необратимые шаги вызывают пробный прогон или предпросмотр плана, чтобы человек проверял план, а не его последствия; а аварийный выключатель с захватом состояния и помещением в карантин может остановить агента посреди выполнения. Отличается от человека в контуре: это позиция надзора, тогда как здесь возможности ограничиваются по обратимости. Отличается от песочницы для агентов: она изолирует среду выполнения, тогда как здесь ранжируется обратимость по каждому инструменту и поэтапно расширяется автономия. Отличается от предотвращения злоупотребления инструментами: оно защищает от злоупотреблений, вызванных инъекцией, а не от классификации радиуса поражения.
- Tools classified by reversibility and impact (read free, write validated, destructive paused)
- Least-privilege tool scoping granted per task
- Graduated autonomy levels earned as reliability is proven
- Dry-run and plan-preview before irreversible actions
- Kill switch with state capture and quarantine
- Worst-case impact bounded before the agent acts, not after
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Проведите red teaming вашей агентной системы
Описанные здесь меры защиты чего-то стоят, только если кто-то попробует их сломать. Мы протестируем вашу систему так, как это сделал бы настоящий атакующий: инъекции промптов, джейлбрейки, злоупотребление инструментами и эксфильтрация данных, каждая находка с готовым исправлением.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября