Loading...
🔬
METR RE-Bench(RE-Bench)
フロンティアモデルを用いたエージェントが ML 研究エンジニアリングのタスクで発揮する性能を測定し、人間の専門家の能力と比較するためのベンチマーク。
複雑さ: high評価とモニタリング
In 30 seconds
- What
- 最先端モデルのエージェントがML研究エンジニアリング課題でどこまでできるかを、完了率、コード品質、研究上の洞察の観点から人間の専門家のベンチマークと比較して測定します。
- When to use
- 最先端モデルが実際の研究エンジニアリング業務をこなせるかを見極めたいとき、あるいはモデルのバージョン間で能力の伸びを比較したいとき。
- Watch out
- 課題選択のバイアスが結果を大きく左右します。範囲が狭すぎる課題や訓練データに似すぎた課題は、現実の研究の多様性に比べてエージェントのスコアを過大に見せます。
Loading technique guide…