正在加载模式…
METR RE-Bench
用于衡量前沿模型智能体在 ML 研究工程任务上表现的基准测试,并将其与人类专家的能力进行对比。
30秒速览
- 是什么
- 在完成率、代码质量和研究洞察三个维度上,衡量前沿模型智能体在机器学习研究工程任务上的表现,并与人类专家基准对比。
- 何时使用
- 需要判断前沿模型能否胜任真实的研究工程工作,或要比较不同模型版本之间的能力提升时。
- 注意
- 任务选择偏差会严重影响结果:任务过于狭窄或与训练数据过于相似,会让智能体的分数相对真实研究的多样性被高估。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
METR RE-Bench: 概览
用于衡量前沿模型智能体在 ML 研究工程任务上表现的基准测试,并将其与人类专家的能力进行对比。
- ML research engineering task evaluation
- Human vs. agent performance comparison
- Frontier model capability assessment
- Research productivity measurement
- Expert-level task benchmarking
- Comprehensive task diversity
获取智能体评估实战指南
25 种智能体评估方法浓缩成一份指南:每个基准测量什么、公开分数何时具有误导性、如何用自己的失败构建评估。链接随确认邮件送达,并附每周的 The Agent Architect。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
- METR RE-Bench: Evaluating R&D Capabilities of LLMs (2024)
- Frontier AI R&D Capabilities Assessment - METR
由本目录背后的工程师执行
看看你的评测漏掉了什么
评测智能体比做出来更难,多数测试套件一路全绿,线上却在悄悄漂移。我们从头到尾检查你的评测体系:现在测到了什么、还有什么看不见,以及当前套件会放过哪些回归。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前