Loading...
MMAU : Compréhension multitâche massive des agents(MMAU)
Benchmark global évaluant les agents sur cinq domaines, avec 20 tâches et 3K+ prompts. L'exemple conserve la liste de modèles de l'époque de sa publication.
In 30 seconds
- What
- Banc d'essai qui teste les agents sur cinq domaines avec plus de 3000 invites, en mesurant la compréhension, le raisonnement, la planification, la résolution de problèmes et l'autocorrection.
- When to use
- Pour comparer les performances d'agents sur des types de problèmes variés, ou vérifier si les améliorations de modèle se traduisent par de vrais gains de capacité dans tous les domaines.
- Watch out
- Coût élevé de mise en place et de calcul ; les résultats reflètent les choix de conception du banc d'essai, pas nécessairement la performance réelle sur vos tâches spécifiques.
Loading technique guide…