Loading...
METR RE-Bench(RE-Bench)
Benchmark de mesure des performances d'agents fondés sur des modèles de pointe pour des tâches d'ingénierie de la recherche en ML, en comparaison avec les capacités d'experts humains.
In 30 seconds
- What
- Mesure les performances des agents de modèles de pointe sur des tâches d'ingénierie de recherche en ML face à des références d'experts humains, sur le taux de réussite, la qualité du code et les intuitions de recherche.
- When to use
- Pour évaluer si les modèles de pointe peuvent assumer un vrai travail d'ingénierie de recherche, ou pour comparer les gains de capacité entre versions de modèles.
- Watch out
- Le biais de sélection des tâches pèse lourdement sur les résultats : des tâches trop étroites ou trop proches des données d'entraînement gonflent les scores des agents par rapport à la diversité réelle de la recherche.
Loading technique guide…