Загружаем паттерны…
METR RE-Bench
Бенчмарк для измерения производительности агентов на базе передовых моделей в задачах инженерии ML-исследований в сравнении со способностями экспертов-людей.
За 30 секунд
- Что это
- Измеряет работу агентов на передовых моделях в задачах инженерии ML-исследований в сравнении с эталонами живых экспертов по доле выполнения, качеству кода и исследовательским выводам.
- Когда применять
- Когда нужно оценить, справятся ли передовые модели с настоящей исследовательской инженерной работой, или сравнить прирост возможностей между версиями моделей.
- Осторожно
- Смещение при отборе задач сильно влияет на результаты: слишком узкие или слишком похожие на обучающие данные задачи завышают оценки агентов относительно реального многообразия исследований.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
METR RE-Bench: Обзор
Бенчмарк для измерения производительности агентов на базе передовых моделей в задачах инженерии ML-исследований в сравнении со способностями экспертов-людей.
- ML research engineering task evaluation
- Human vs. agent performance comparison
- Frontier model capability assessment
- Research productivity measurement
- Expert-level task benchmarking
- Comprehensive task diversity
Получите полевой гид по оценке агентов
Все 25 методов оценки агентов в одном гиде: какой бенчмарк что измеряет, когда публичный балл вводит в заблуждение и как строить оценки на собственных сбоях. Ссылка приходит вместе с подтверждением, вместе с еженедельным The Agent Architect.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
- METR RE-Bench: Evaluating R&D Capabilities of LLMs (2024)
- Frontier AI R&D Capabilities Assessment - METR
От инженера, создавшего этот каталог
Узнайте, что упускают ваши оценки
Измерять агента сложнее, чем его выпустить, и большинство наборов тестов остаются зелёными, пока продакшн уходит в сторону. Мы разберём вашу систему оценки целиком: что вы измеряете сейчас, чего пока не видите и какие регрессии текущий набор пропустит.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября