パターンを読み込んでいます…
MMAU:大規模マルチタスクエージェント理解
エージェントを 5 つのドメインにわたり、20 のタスクと 3K+ 個のプロンプトで評価する包括的なベンチマーク。例では、公開当時のモデル構成をそのまま残しています。
30秒でわかる概要
- 概要
- 3000件を超えるプロンプトで五つの領域にわたりエージェントを試し、理解、推論、計画、問題解決、自己修正を測るベンチマーク。
- 使いどころ
- 多様な問題タイプにわたってエージェントの性能を比較したいとき、あるいはモデルの改良が各領域で実際の能力向上につながっているかを追跡したいとき。
- 注意点
- セットアップと計算のコストが高くつきます。結果はベンチマークの設計上の選択を映すものであり、あなた固有のタスクでの実際の性能を必ずしも表しません。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
MMAU:大規模マルチタスクエージェント理解: 概要
エージェントを 5 つのドメインにわたり、20 のタスクと 3K+ 個のプロンプトで評価する包括的なベンチマーク。例では、公開当時のモデル構成をそのまま残しています。
- Five core domains: Tool-use, DAG QA, Data Science, Programming, Mathematics
- Five essential capabilities assessment
- 20 meticulously designed tasks
- 3K+ distinct prompts
- Comprehensive offline evaluation
- No complex environment setup required
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse DomainsarXiv:2407.18961
- Apple Machine Learning Research - MMAU (2024)
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで