Loading...
METR RE-Bench(RE-Bench)
Бенчмарк для измерения производительности агентов на базе передовых моделей в задачах инженерии ML-исследований в сравнении со способностями экспертов-людей.
In 30 seconds
- What
- Измеряет работу агентов на передовых моделях в задачах инженерии ML-исследований в сравнении с эталонами живых экспертов по доле выполнения, качеству кода и исследовательским выводам.
- When to use
- Когда нужно оценить, справятся ли передовые модели с настоящей исследовательской инженерной работой, или сравнить прирост возможностей между версиями моделей.
- Watch out
- Смещение при отборе задач сильно влияет на результаты: слишком узкие или слишком похожие на обучающие данные задачи завышают оценки агентов относительно реального многообразия исследований.
Loading technique guide…