Loading...
🛫
tau-bench (Tool-Agent-User)(TAU)
エージェントを、シミュレートされた人間のユーザーとドメイン API 群(小売、航空)の間に置き、書かれたポリシー文書に従わせるベンチマーク。単一の応答をチェックするのではなく、会話全体が終わった後のデータベースの最終状態を目標状態と比較します。特徴的な指標は pass^k で、同じタスクを k 回独立に試行してすべて成功する確率を表し、平均化された pass@1 のスコアでは見えない一貫性の欠如を明らかにします。
複雑さ: high評価とモニタリング
In 30 seconds
- What
- ユーザーとエージェントと API のやり取りをシミュレートし、複数回の独立した試行にわたって最終的なデータベース状態を目標状態と照合することで、一貫性まで含めてエージェントを評価します。
- When to use
- 小売、航空、通信といった業務フローで実際のシステム状態を操作しながら、ユーザーからの圧力の下でもドメインのポリシーを確実に守れるかを検証したいときに。
- Watch out
- pass^k スコアのばらつきが大きいと、たまたま一度成功しただけで実は体系的に失敗しているエージェントを見落としかねません。本当の脆さを捉えるには多数の試行が必要です。
Loading technique guide…