Loading...
Cadre d'évaluation des agents HELM(HELM-AE)
L'Holistic Evaluation of Language Models de Stanford CRFM, étendue aux capacités des agents. L'exemple détaillé est un instantané de benchmark daté, et non une recommandation de modèle actuelle.
In 30 seconds
- What
- Mesure les performances d'un agent selon sept dimensions : exactitude, calibration, robustesse, équité, biais, toxicité et efficacité, y compris l'usage d'outils et les interactions API dans des scénarios standardisés.
- When to use
- Comparer plusieurs agents avant leur mise en production ou suivre les régressions de performance entre versions de modèles et intégrations d'outils.
- Watch out
- Les scores de benchmark ne prédisent pas les performances réelles ; vos tâches concrètes peuvent différer sensiblement des 42 scénarios de test.
Loading technique guide…