Loading...
MMAU: Massives Multitask-Verständnis von Agenten(MMAU)
Ganzheitlicher Benchmark, der Agenten über fünf Domänen hinweg mit 20 Aufgaben und 3K+ Prompts bewertet. Das Beispiel behält die Modellauswahl aus der Zeit der Veröffentlichung bei.
In 30 seconds
- What
- Benchmark, der Agenten über fünf Domänen hinweg mit mehr als 3000 Prompts testet und Verständnis, Schlussfolgern, Planung, Problemlösung und Selbstkorrektur misst.
- When to use
- Wenn Sie die Leistung von Agenten über verschiedene Problemtypen hinweg vergleichen oder verfolgen wollen, ob Modellverbesserungen sich in echte Fähigkeitszuwächse über alle Domänen übersetzen.
- Watch out
- Hoher Aufwand für Einrichtung und Rechenleistung; die Ergebnisse spiegeln die Designentscheidungen des Benchmarks wider, nicht zwingend die reale Leistung bei Ihren konkreten Aufgaben.
Loading technique guide…