Loading...
AgentBench(AgentBench)
最初的 AgentBench 研究在 8 个多样化环境以及多轮、开放式设置中评估了其公布的模型阵容。
In 30 seconds
- What
- 让代理在八种不同环境(SQL、游戏、网页、操作系统)中进行多轮交互,衡量其跨领域的真实能力。
- When to use
- 比较不同代理模型,或验证你的代理能否处理超出单一领域基准的多样化开放式任务。
- Watch out
- 复杂度和算力开销都很高;结果未必能迁移到你的具体用例或自定义环境。
Loading technique guide…