Loading...
tau-bench (Tool-Agent-User)(TAU)
Бенчмарк, который помещает агента между симулированным пользователем-человеком и набором доменных API (розничная торговля, авиакомпания), при этом агент обязан следовать письменному документу с правилами. Вместо проверки одного ответа он сравнивает итоговое состояние базы данных с целевым состоянием после всего диалога. Его фирменной метрикой является pass^k, то есть вероятность успешно пройти все k независимых попыток одной и той же задачи, что выявляет сбои согласованности, скрытые усреднёнными оценками pass@1.
In 30 seconds
- What
- Оценивает агентов, моделируя разговор между пользователем, агентом и API, и сравнивает итоговое состояние базы данных с целевым в нескольких независимых испытаниях, чтобы измерить стабильность.
- When to use
- Когда нужно проверить, надёжно ли агент соблюдает отраслевые правила под давлением пользователя, изменяя при этом реальное состояние системы в сценариях розницы, авиаперевозок или телекома.
- Watch out
- Большой разброс значений pass^k может скрыть, что агент однажды преуспел случайно, а в целом ошибается систематически; чтобы увидеть настоящую хрупкость, нужно много испытаний.
Loading technique guide…