パターンを読み込んでいます…
tau-bench (Tool-Agent-User)(TAU)
エージェントを、シミュレートされた人間のユーザーとドメイン API 群(小売、航空)の間に置き、書かれたポリシー文書に従わせるベンチマーク。単一の応答をチェックするのではなく、会話全体が終わった後のデータベースの最終状態を目標状態と比較します。特徴的な指標は pass^k で、同じタスクを k 回独立に試行してすべて成功する確率を表し、平均化された pass@1 のスコアでは見えない一貫性の欠如を明らかにします。
30秒でわかる概要
- 概要
- ユーザーとエージェントと API のやり取りをシミュレートし、複数回の独立した試行にわたって最終的なデータベース状態を目標状態と照合することで、一貫性まで含めてエージェントを評価します。
- 使いどころ
- 小売、航空、通信といった業務フローで実際のシステム状態を操作しながら、ユーザーからの圧力の下でもドメインのポリシーを確実に守れるかを検証したいときに。
- 注意点
- pass^k スコアのばらつきが大きいと、たまたま一度成功しただけで実は体系的に失敗しているエージェントを見落としかねません。本当の脆さを捉えるには多数の試行が必要です。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
tau-bench (Tool-Agent-User): 概要
エージェントを、シミュレートされた人間のユーザーとドメイン API 群(小売、航空)の間に置き、書かれたポリシー文書に従わせるベンチマーク。単一の応答をチェックするのではなく、会話全体が終わった後のデータベースの最終状態を目標状態と比較します。特徴的な指標は pass^k で、同じタスクを k 回独立に試行してすべて成功する確率を表し、平均化された pass@1 のスコアでは見えない一貫性の欠如を明らかにします。
- Agent mediates between a simulated user (LLM-driven) and domain APIs
- Two domains: retail and airline, each with tools and a written policy document
- Scores the final database state against a goal state, not just the text reply
- pass^k reliability metric across k independent trials of the same task
- Policy adherence testing: agent must follow domain rules under user pressure
- tau2-bench extends the setting with a dual-control telecom domain and stronger user simulation
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで