Загружаем паттерны…
Набор SWE-bench
Набор бенчмарков для программной инженерии, включающий SWE-bench, SWE-bench Verified и SWE-bench Live. Указанные в примере для сравнения модели являются историческими ориентирами.
За 30 секунд
- Что это
- Оценивает кодовых агентов на настоящих issue из популярных репозиториев GitHub, используя проверенные людьми подмножества и ежемесячно обновляемые live-варианты для измерения способности решать задачи.
- Когда применять
- Сравнение агентов на настоящих задачах разработки, отслеживание прогресса во времени или проверка того, что агенты решают задачи без загрязнения обучающими данными.
- Осторожно
- Результаты сильно зависят от того, какие репозитории и типы issue включены; показатели на SWE-bench могут не перенестись на паттерны и технологический стек вашей кодовой базы.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Набор SWE-bench: Обзор
Набор бенчмарков для программной инженерии, включающий SWE-bench, SWE-bench Verified и SWE-bench Live. Указанные в примере для сравнения модели являются историческими ориентирами.
- Real GitHub issues from 12+ popular repositories
- Human-validated problem subset (SWE-bench Verified)
- Live benchmark updated monthly (SWE-bench Live)
- Multimodal variant with visual elements
- Contamination-free evaluation
- Industry standard for coding agents
Получите полевой гид по оценке агентов
Все 25 методов оценки агентов в одном гиде: какой бенчмарк что измеряет, когда публичный балл вводит в заблуждение и как строить оценки на собственных сбоях. Ссылка приходит вместе с подтверждением, вместе с еженедельным The Agent Architect.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (ICLR 2024)arXiv:2310.06770
- Introducing SWE-bench Verified - OpenAI (2024)
- swebench.com
От инженера, создавшего этот каталог
Узнайте, что упускают ваши оценки
Измерять агента сложнее, чем его выпустить, и большинство наборов тестов остаются зелёными, пока продакшн уходит в сторону. Мы разберём вашу систему оценки целиком: что вы измеряете сейчас, чего пока не видите и какие регрессии текущий набор пропустит.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября