パターンを読み込んでいます…
METR RE-Bench
フロンティアモデルを用いたエージェントが ML 研究エンジニアリングのタスクで発揮する性能を測定し、人間の専門家の能力と比較するためのベンチマーク。
30秒でわかる概要
- 概要
- 最先端モデルのエージェントがML研究エンジニアリング課題でどこまでできるかを、完了率、コード品質、研究上の洞察の観点から人間の専門家のベンチマークと比較して測定します。
- 使いどころ
- 最先端モデルが実際の研究エンジニアリング業務をこなせるかを見極めたいとき、あるいはモデルのバージョン間で能力の伸びを比較したいとき。
- 注意点
- 課題選択のバイアスが結果を大きく左右します。範囲が狭すぎる課題や訓練データに似すぎた課題は、現実の研究の多様性に比べてエージェントのスコアを過大に見せます。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
METR RE-Bench: 概要
フロンティアモデルを用いたエージェントが ML 研究エンジニアリングのタスクで発揮する性能を測定し、人間の専門家の能力と比較するためのベンチマーク。
- ML research engineering task evaluation
- Human vs. agent performance comparison
- Frontier model capability assessment
- Research productivity measurement
- Expert-level task benchmarking
- Comprehensive task diversity
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- METR RE-Bench: Evaluating R&D Capabilities of LLMs (2024)
- Frontier AI R&D Capabilities Assessment - METR
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで