Загружаем паттерны…
Наблюдаемость и трассировка агентов(AOT)
Пошаговая трассировка в продакшене, которая записывает каждый вызов модели, вызов инструмента, шаг рабочего процесса и субагента как span в едином дереве запуска с аннотациями по метрикам токенов, задержки и стоимости. Стандартизированная через семантические соглашения OpenTelemetry GenAI (атрибуты gen_ai.*) и отображаемая на платформах вроде LangSmith, Braintrust и Datadog, она служит оперативным сигналом для отладки недетерминированных сбоев в продакшене, в отличие от офлайн-бенчмарков, которые оценивают поведение до развёртывания.
За 30 секунд
- Что это
- Записывает каждый вызов модели, вызов инструмента и шаг рабочего процесса как спан с временной меткой, количеством токенов, задержкой и стоимостью, собирая всё в единое дерево запуска для отладки в продакшене.
- Когда применять
- Продакшен-системы, где сбои многошаговых агентов недетерминированы, плохо воспроизводятся офлайн или требуют анализа первопричин на стыке модели и инструментов.
- Осторожно
- Накладные расходы и стоимость хранения быстро растут при подробном логировании, а неаккуратная запись чувствительных данных (персональных данных, секретов) из промптов и ответов создаёт риски для комплаенса и безопасности.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Наблюдаемость и трассировка агентов: Обзор
Пошаговая трассировка в продакшене, которая записывает каждый вызов модели, вызов инструмента, шаг рабочего процесса и субагента как span в едином дереве запуска с аннотациями по метрикам токенов, задержки и стоимости. Стандартизированная через семантические соглашения OpenTelemetry GenAI (атрибуты gen_ai.*) и отображаемая на платформах вроде LangSmith, Braintrust и Datadog, она служит оперативным сигналом для отладки недетерминированных сбоев в продакшене, в отличие от офлайн-бенчмарков, которые оценивают поведение до развёртывания.
- Hierarchical spans for model calls, tool calls, workflow steps, and sub-agents
- Per-span token counts, latency, and cost roll-ups across the run tree
- OpenTelemetry GenAI semantic conventions (gen_ai.* attributes) for vendor-neutral traces
- Full input/output and prompt/response capture for replay and root-cause analysis
- Root-cause debugging of non-deterministic multi-step failures in production
- Live dashboards, alerting, and drill-down surfaced by LangSmith, Braintrust, and Datadog
Получите полевой гид по оценке агентов
Все 25 методов оценки агентов в одном гиде: какой бенчмарк что измеряет, когда публичный балл вводит в заблуждение и как строить оценки на собственных сбоях. Ссылка приходит вместе с подтверждением, вместе с еженедельным The Agent Architect.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
- OpenTelemetry GenAI Semantic Conventions
- LangSmith Observability Documentation
- Braintrust: Tracing and Evaluation for AI Applications
- Datadog LLM Observability
От инженера, создавшего этот каталог
Узнайте, что упускают ваши оценки
Измерять агента сложнее, чем его выпустить, и большинство наборов тестов остаются зелёными, пока продакшн уходит в сторону. Мы разберём вашу систему оценки целиком: что вы измеряете сейчас, чего пока не видите и какие регрессии текущий набор пропустит.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября