Загружаем паттерны…
Постепенное развёртывание и теневой режим(PRS)
Сторона развёртывания, отвечающая за безопасный выпуск новой версии агента или промпта. Кандидат сначала работает в теневом режиме: он выполняется на реальном продакшен-трафике, но его вывод скрыт от пользователей и офлайн сравнивается с обслуживающей версией; затем он переходит к canary на объёме от 1 до 5 процентов живого трафика, где оценивается с помощью онлайн-evals относительно контрольной группы, а далее к постепенному наращиванию, с автоматическим откатом в тот момент, когда отслеживаемая метрика ухудшается. Сочетание онлайн-evals (оценивающих живой трафик на лету) с офлайн-evals ловит длиннохвостые сбои, которые статичный эталонный набор предсказать не может. В отличие от eval-driven-agent-development, которая контролирует изменения офлайн до слияния, этот подход управляет онлайн-наращиванием после слияния.
За 30 секунд
- Что это
- Запускает кандидатного агента на боевом трафике, не отдавая его вывод пользователям, а затем постепенно открывает его для пользователей с автоматическим откатом при ухудшении метрик.
- Когда применять
- Выкатка изменений агента или промпта, когда отказы из длинного хвоста на реальном трафике важнее статических тестовых наборов, и нужна уверенность перед полным развёртыванием.
- Осторожно
- Задержка и стоимость онлайн-оценки растут вместе с объёмом трафика; медленный или дорогой оценщик может стать узким местом раньше, чем вы поймаете настоящие проблемы.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Постепенное развёртывание и теневой режим: Обзор
Сторона развёртывания, отвечающая за безопасный выпуск новой версии агента или промпта. Кандидат сначала работает в теневом режиме: он выполняется на реальном продакшен-трафике, но его вывод скрыт от пользователей и офлайн сравнивается с обслуживающей версией; затем он переходит к canary на объёме от 1 до 5 процентов живого трафика, где оценивается с помощью онлайн-evals относительно контрольной группы, а далее к постепенному наращиванию, с автоматическим откатом в тот момент, когда отслеживаемая метрика ухудшается. Сочетание онлайн-evals (оценивающих живой трафик на лету) с офлайн-evals ловит длиннохвостые сбои, которые статичный эталонный набор предсказать не может. В отличие от eval-driven-agent-development, которая контролирует изменения офлайн до слияния, этот подход управляет онлайн-наращиванием после слияния.
- Shadow mode: candidate runs on live traffic, output withheld, compared offline
- Canary on 1-5% of live traffic scored by online evals against a control
- Progressive ramp with predefined promotion and rollback thresholds
- Automatic rollback triggered by a monitored metric regression
- Online evals (in-flight scoring) paired with offline evals for long-tail failures
- Per-request telemetry span ties the eval score to the routing decision for auto-gating
Получите полевой гид по оценке агентов
Все 25 методов оценки агентов в одном гиде: какой бенчмарк что измеряет, когда публичный балл вводит в заблуждение и как строить оценки на собственных сбоях. Ссылка приходит вместе с подтверждением, вместе с еженедельным The Agent Architect.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Узнайте, что упускают ваши оценки
Измерять агента сложнее, чем его выпустить, и большинство наборов тестов остаются зелёными, пока продакшн уходит в сторону. Мы разберём вашу систему оценки целиком: что вы измеряете сейчас, чего пока не видите и какие регрессии текущий набор пропустит.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября