Загружаем паттерны…
tau-bench (Tool-Agent-User)(TAU)
Бенчмарк, который помещает агента между симулированным пользователем-человеком и набором доменных API (розничная торговля, авиакомпания), при этом агент обязан следовать письменному документу с правилами. Вместо проверки одного ответа он сравнивает итоговое состояние базы данных с целевым состоянием после всего диалога. Его фирменной метрикой является pass^k, то есть вероятность успешно пройти все k независимых попыток одной и той же задачи, что выявляет сбои согласованности, скрытые усреднёнными оценками pass@1.
За 30 секунд
- Что это
- Оценивает агентов, моделируя разговор между пользователем, агентом и API, и сравнивает итоговое состояние базы данных с целевым в нескольких независимых испытаниях, чтобы измерить стабильность.
- Когда применять
- Когда нужно проверить, надёжно ли агент соблюдает отраслевые правила под давлением пользователя, изменяя при этом реальное состояние системы в сценариях розницы, авиаперевозок или телекома.
- Осторожно
- Большой разброс значений pass^k может скрыть, что агент однажды преуспел случайно, а в целом ошибается систематически; чтобы увидеть настоящую хрупкость, нужно много испытаний.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
tau-bench (Tool-Agent-User): Обзор
Бенчмарк, который помещает агента между симулированным пользователем-человеком и набором доменных API (розничная торговля, авиакомпания), при этом агент обязан следовать письменному документу с правилами. Вместо проверки одного ответа он сравнивает итоговое состояние базы данных с целевым состоянием после всего диалога. Его фирменной метрикой является pass^k, то есть вероятность успешно пройти все k независимых попыток одной и той же задачи, что выявляет сбои согласованности, скрытые усреднёнными оценками pass@1.
- Agent mediates between a simulated user (LLM-driven) and domain APIs
- Two domains: retail and airline, each with tools and a written policy document
- Scores the final database state against a goal state, not just the text reply
- pass^k reliability metric across k independent trials of the same task
- Policy adherence testing: agent must follow domain rules under user pressure
- tau2-bench extends the setting with a dual-control telecom domain and stronger user simulation
Получите полевой гид по оценке агентов
Все 25 методов оценки агентов в одном гиде: какой бенчмарк что измеряет, когда публичный балл вводит в заблуждение и как строить оценки на собственных сбоях. Ссылка приходит вместе с подтверждением, вместе с еженедельным The Agent Architect.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Узнайте, что упускают ваши оценки
Измерять агента сложнее, чем его выпустить, и большинство наборов тестов остаются зелёными, пока продакшн уходит в сторону. Мы разберём вашу систему оценки целиком: что вы измеряете сейчас, чего пока не видите и какие регрессии текущий набор пропустит.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября