Loading...
HELM 智能体评估框架(HELM-AE)
斯坦福 CRFM 的 Holistic Evaluation of Language Models 针对智能体能力的扩展。所举实例是某一时点的过时基准快照,而非当前的模型推荐。
In 30 seconds
- What
- 从准确性、校准度、鲁棒性、公平性、偏见、毒性和效率这七个维度衡量智能体表现,并在标准化场景中考察工具使用和 API 交互。
- When to use
- 在部署前比较多个智能体,或跨模型版本与工具集成追踪性能回退。
- Watch out
- 基准测试分数无法预测真实场景中的表现;你的实际任务可能与这 42 个测试场景相差甚远。
Loading technique guide…