Loading...
MMAU:大規模マルチタスクエージェント理解(MMAU)
エージェントを 5 つのドメインにわたり、20 のタスクと 3K+ 個のプロンプトで評価する包括的なベンチマーク。例では、公開当時のモデル構成をそのまま残しています。
In 30 seconds
- What
- 3000件を超えるプロンプトで五つの領域にわたりエージェントを試し、理解、推論、計画、問題解決、自己修正を測るベンチマーク。
- When to use
- 多様な問題タイプにわたってエージェントの性能を比較したいとき、あるいはモデルの改良が各領域で実際の能力向上につながっているかを追跡したいとき。
- Watch out
- セットアップと計算のコストが高くつきます。結果はベンチマークの設計上の選択を映すものであり、あなた固有のタスクでの実際の性能を必ずしも表しません。
Loading technique guide…