Loading...
MLR-Bench(MLR-Bench)
Комплексный бенчмарк для оценки ИИ-агентов на открытых исследовательских задачах машинного обучения с ведущих конференций по ML.
In 30 seconds
- What
- Стандартизованный бенчмарк из 201 задачи ML-исследований с ведущих конференций и автоматической оценкой по методологии, реализации и анализу.
- When to use
- Когда нужно оценить, справляется ли ваш исследовательский агент с открытыми задачами ML уровня опубликованных конференционных работ в нескольких подобластях.
- Watch out
- Оценки отражают работу на узких задачах; агенты могут переобучиться на шаблоны бенчмарка и не обобщать на новые направления исследований за пределами этих 9 областей.
Loading technique guide…