Chargement des modèles…
METR RE-Bench
Benchmark de mesure des performances d'agents fondés sur des modèles de pointe pour des tâches d'ingénierie de la recherche en ML, en comparaison avec les capacités d'experts humains.
Aperçu en 30 secondes
- Quoi
- Mesure les performances des agents de modèles de pointe sur des tâches d'ingénierie de recherche en ML face à des références d'experts humains, sur le taux de réussite, la qualité du code et les intuitions de recherche.
- Quand l'utiliser
- Pour évaluer si les modèles de pointe peuvent assumer un vrai travail d'ingénierie de recherche, ou pour comparer les gains de capacité entre versions de modèles.
- Vigilance
- Le biais de sélection des tâches pèse lourdement sur les résultats : des tâches trop étroites ou trop proches des données d'entraînement gonflent les scores des agents par rapport à la diversité réelle de la recherche.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
METR RE-Bench: Vue d’ensemble
Benchmark de mesure des performances d'agents fondés sur des modèles de pointe pour des tâches d'ingénierie de la recherche en ML, en comparaison avec les capacités d'experts humains.
- ML research engineering task evaluation
- Human vs. agent performance comparison
- Frontier model capability assessment
- Research productivity measurement
- Expert-level task benchmarking
- Comprehensive task diversity
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
- METR RE-Bench: Evaluating R&D Capabilities of LLMs (2024)
- Frontier AI R&D Capabilities Assessment - METR
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre