Loading...
🔬
MLR-Bench(MLR-Bench)
用于在源自顶级 ML 会议的开放式机器学习研究任务上评估 AI 智能体的综合基准。
复杂度: high评估与监控
In 30 seconds
- What
- 标准化基准,包含来自顶级会议的 201 项机器学习研究任务,并在方法论、实现和分析三个维度上自动评估。
- When to use
- 需要评估你的研究智能体能否在多个子领域中处理达到会议论文水准的开放式机器学习问题时。
- Watch out
- 分数反映的是狭窄任务上的表现;智能体可能过拟合基准的固有模式,而无法泛化到这 9 个领域之外的新研究方向。
Loading technique guide…