Loading...
🌍
GAIA:通用 AI 助手基准测试(GAIA)
最初的 GAIA 基准测试考察推理、多模态、网页浏览和工具使用能力。其中用于比较的具名模型是论文当时的历史基线。
复杂度: high评估与监控
In 30 seconds
- What
- 包含 450 多道题目、覆盖三个难度等级的基准测试集,以 92% 的人类基线衡量推理、多模态、工具使用和网页浏览能力。
- When to use
- 在需要多种能力的真实任务上比较智能体表现;找出推理、视觉和工具集成方面的性能差距。
- Watch out
- 结果只反映在特定题目分布上的一次快照表现;智能体可能过拟合基准的模式,无法泛化到新的真实问题。
Loading technique guide…