Loading...
GAIA : Benchmark pour assistants IA généralistes(GAIA)
Le benchmark GAIA original évaluait le raisonnement, la multimodalité, la navigation web et l'utilisation d'outils. Le modèle cité en comparaison constitue la référence historique de l'article.
In 30 seconds
- What
- Suite de tests comptant plus de 450 questions réparties sur trois niveaux de difficulté, qui mesure le raisonnement, la multimodalité, l'usage d'outils et la navigation web face à une référence humaine de 92 %.
- When to use
- Comparer les capacités d'agents sur des tâches réelles exigeant plusieurs compétences ; repérer les écarts de performance en raisonnement, en vision et en intégration d'outils.
- Watch out
- Les résultats reflètent une performance instantanée sur une distribution de questions donnée ; les agents peuvent surapprendre les schémas du benchmark sans généraliser à de nouveaux problèmes réels.
Loading technique guide…