Loading...
🏢
TheAgentCompany Benchmark(TAC)
在软件工程公司中通常由多个岗位角色共同完成的、具有重要影响的真实任务上,对 LLM 智能体进行基准测试。
复杂度: high评估与监控
In 30 seconds
- What
- 在跨越软件工程各类岗位的多步骤专业任务上衡量智能体表现,并分别为完整完成和部分完成计分。
- When to use
- 在部署前用贴近真实的工作场景对比 LLM 智能体,或跨模型版本追踪能力提升。
- Watch out
- 部分得分可能掩盖智能体在关键步骤上的失败:39% 的部分得分背后,可能是毫无价值的半成品。
Loading technique guide…