Loading...
🛫
tau-bench (Tool-Agent-User)(TAU)
该基准测试将智能体置于模拟的人类用户与一组领域 API(零售、航空)之间,同时要求其遵守一份书面政策文档。它不是检查单个回复,而是在完整对话结束后,将数据库的最终状态与目标状态进行比较。其标志性指标是 pass^k,即在同一任务的全部 k 次独立试验中都成功的概率,这能揭示被平均化的 pass@1 分数所掩盖的一致性缺陷。
复杂度: high评估与监控
In 30 seconds
- What
- 通过模拟用户、智能体与 API 之间的对话来评估智能体,在多次独立试验中将最终数据库状态与目标状态比对,以衡量一致性。
- When to use
- 用于检验智能体在用户施压下能否可靠遵守领域策略,同时在零售、航空或电信业务流程中改动真实的系统状态。
- Watch out
- pass^k 分数方差过大,可能掩盖某个智能体只是侥幸成功一次、实则系统性失败的事实;要发现真正的脆弱性需要大量试验。
Loading technique guide…