Loading...
AgentBench(AgentBench)
L'étude AgentBench originale a évalué la liste de modèles publiée dans 8 environnements variés ainsi que dans des contextes multi-tours et ouverts.
In 30 seconds
- What
- Fait passer les agents par huit environnements variés (SQL, jeux, web, systèmes d'exploitation) avec des interactions multi-tours, afin de mesurer leurs capacités réelles dans plusieurs domaines.
- When to use
- Comparer des modèles d'agents ou vérifier si votre agent gère des tâches variées et ouvertes, au-delà des benchmarks mono-domaine.
- Watch out
- Complexité et coût de calcul élevés ; les résultats ne se transposent pas forcément à vos cas d'usage précis ou à vos environnements personnalisés.
Loading technique guide…