Loading...
MMAU:大规模多任务智能体理解(MMAU)
在五个领域中通过 20 项任务和 3K+ 条提示词全面评估智能体的基准测试。示例保留了其发布时期的模型阵容。
In 30 seconds
- What
- 用 3000 多条提示在五个领域考察智能体,衡量理解、推理、规划、问题解决和自我纠错能力的基准测试。
- When to use
- 需要在多种问题类型上横向比较智能体表现,或跟踪模型改进是否真正转化为跨领域能力提升时。
- Watch out
- 搭建和算力成本都很高;结果反映的是基准的设计取舍,未必等同于它在你具体任务上的真实表现。
Loading technique guide…