正在加载模式…
tau-bench (Tool-Agent-User)(TAU)
该基准测试将智能体置于模拟的人类用户与一组领域 API(零售、航空)之间,同时要求其遵守一份书面政策文档。它不是检查单个回复,而是在完整对话结束后,将数据库的最终状态与目标状态进行比较。其标志性指标是 pass^k,即在同一任务的全部 k 次独立试验中都成功的概率,这能揭示被平均化的 pass@1 分数所掩盖的一致性缺陷。
30秒速览
- 是什么
- 通过模拟用户、智能体与 API 之间的对话来评估智能体,在多次独立试验中将最终数据库状态与目标状态比对,以衡量一致性。
- 何时使用
- 用于检验智能体在用户施压下能否可靠遵守领域策略,同时在零售、航空或电信业务流程中改动真实的系统状态。
- 注意
- pass^k 分数方差过大,可能掩盖某个智能体只是侥幸成功一次、实则系统性失败的事实;要发现真正的脆弱性需要大量试验。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
tau-bench (Tool-Agent-User): 概览
该基准测试将智能体置于模拟的人类用户与一组领域 API(零售、航空)之间,同时要求其遵守一份书面政策文档。它不是检查单个回复,而是在完整对话结束后,将数据库的最终状态与目标状态进行比较。其标志性指标是 pass^k,即在同一任务的全部 k 次独立试验中都成功的概率,这能揭示被平均化的 pass@1 分数所掩盖的一致性缺陷。
- Agent mediates between a simulated user (LLM-driven) and domain APIs
- Two domains: retail and airline, each with tools and a written policy document
- Scores the final database state against a goal state, not just the text reply
- pass^k reliability metric across k independent trials of the same task
- Policy adherence testing: agent must follow domain rules under user pressure
- tau2-bench extends the setting with a dual-control telecom domain and stronger user simulation
获取智能体评估实战指南
25 种智能体评估方法浓缩成一份指南:每个基准测量什么、公开分数何时具有误导性、如何用自己的失败构建评估。链接随确认邮件送达,并附每周的 The Agent Architect。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
看看你的评测漏掉了什么
评测智能体比做出来更难,多数测试套件一路全绿,线上却在悄悄漂移。我们从头到尾检查你的评测体系:现在测到了什么、还有什么看不见,以及当前套件会放过哪些回归。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前