Loading...
GAIA: бенчмарк для универсальных ИИ-ассистентов(GAIA)
Первоначальный бенчмарк GAIA проверял рассуждение, мультимодальность, работу с веб-браузером и использование инструментов. Названная в сравнении модель служит историческим ориентиром из статьи.
In 30 seconds
- What
- Набор тестов из более чем 450 вопросов трёх уровней сложности, измеряющий рассуждение, мультимодальность, работу с инструментами и веб-поиск относительно человеческого показателя в 92 %.
- When to use
- Сравнение возможностей агентов на реальных задачах, требующих нескольких навыков; выявление провалов в рассуждении, зрении и интеграции инструментов.
- Watch out
- Результаты отражают срез производительности на конкретном распределении вопросов; агенты могут переобучиться на шаблоны бенчмарка и не обобщать на новые реальные задачи.
Loading technique guide…