Loading...
🔬
METR RE-Bench(RE-Bench)
用于衡量前沿模型智能体在 ML 研究工程任务上表现的基准测试,并将其与人类专家的能力进行对比。
复杂度: high评估与监控
In 30 seconds
- What
- 在完成率、代码质量和研究洞察三个维度上,衡量前沿模型智能体在机器学习研究工程任务上的表现,并与人类专家基准对比。
- When to use
- 需要判断前沿模型能否胜任真实的研究工程工作,或要比较不同模型版本之间的能力提升时。
- Watch out
- 任务选择偏差会严重影响结果:任务过于狭窄或与训练数据过于相似,会让智能体的分数相对真实研究的多样性被高估。
Loading technique guide…