Loading...
MLR-Bench(MLR-Bench)
トップクラスのML学会に由来するオープンエンドな機械学習研究タスクでAIエージェントを評価する包括的なベンチマーク。
In 30 seconds
- What
- トップカンファレンス由来の201件のML研究課題からなる標準化ベンチマークで、方法論、実装、分析の各観点を自動評価します。
- When to use
- あなたの研究エージェントが、複数のサブ分野にまたがる、学会発表水準に匹敵するオープンエンドなML課題を扱えるかを見極めたいとき。
- Watch out
- スコアが示すのは狭い課題での成績です。エージェントはベンチマークのパターンに過剰適合し、この9分野の外にある新しい研究方向へは一般化しないことがあります。
Loading technique guide…