Loading...
MMAU: масштабное многозадачное понимание агентов(MMAU)
Комплексный бенчмарк, оценивающий агентов в пяти областях с помощью 20 задач и 3K+ промптов. Пример сохраняет состав моделей на момент публикации.
In 30 seconds
- What
- Бенчмарк, который проверяет агентов в пяти областях более чем на 3000 промптах, измеряя понимание, рассуждение, планирование, решение задач и самокоррекцию.
- When to use
- Когда нужно сравнить работу агентов на разных типах задач или отследить, превращаются ли улучшения модели в реальный прирост возможностей по всем областям.
- Watch out
- Высокие затраты на настройку и вычисления; результаты отражают проектные решения бенчмарка, а не обязательно реальную работу на ваших конкретных задачах.
Loading technique guide…