Loading...
MLR-Bench(MLR-Bench)
Benchmark complet pour évaluer les agents d'IA sur des tâches de recherche ouvertes en apprentissage automatique, issues des principales conférences de ML.
In 30 seconds
- What
- Banc d'essai standardisé de 201 tâches de recherche en ML issues des meilleures conférences, avec une évaluation automatisée sur les axes méthodologie, implémentation et analyse.
- When to use
- Pour évaluer si votre agent de recherche sait traiter des problèmes de ML ouverts, comparables à des travaux publiés en conférence, à travers plusieurs sous-domaines.
- Watch out
- Les scores reflètent la performance sur des tâches étroites ; les agents peuvent surapprendre les motifs du banc d'essai sans généraliser à des directions de recherche inédites hors de ces 9 domaines.
Loading technique guide…