Chargement des modèles…
MLR-Bench
Benchmark complet pour évaluer les agents d'IA sur des tâches de recherche ouvertes en apprentissage automatique, issues des principales conférences de ML.
Aperçu en 30 secondes
- Quoi
- Banc d'essai standardisé de 201 tâches de recherche en ML issues des meilleures conférences, avec une évaluation automatisée sur les axes méthodologie, implémentation et analyse.
- Quand l'utiliser
- Pour évaluer si votre agent de recherche sait traiter des problèmes de ML ouverts, comparables à des travaux publiés en conférence, à travers plusieurs sous-domaines.
- Vigilance
- Les scores reflètent la performance sur des tâches étroites ; les agents peuvent surapprendre les motifs du banc d'essai sans généraliser à des directions de recherche inédites hors de ces 9 domaines.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
MLR-Bench: Vue d’ensemble
Benchmark complet pour évaluer les agents d'IA sur des tâches de recherche ouvertes en apprentissage automatique, issues des principales conférences de ML.
- 201 research tasks from NeurIPS/ICLR/ICML
- MLR-Judge automated evaluation
- Covers 9 core ML research areas
- Real workshop paper tasks
- Modular research agent scaffold
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre