Loading...
Фреймворк оценки агентов HELM(HELM-AE)
Holistic Evaluation of Language Models от Stanford CRFM, расширенная для оценки возможностей агентов. Разобранный пример представляет собой устаревший снимок бенчмарка, а не рекомендацию актуальной модели.
In 30 seconds
- What
- Измеряет качество работы агента по семи измерениям: точность, калибровка, устойчивость, справедливость, предвзятость, токсичность и эффективность, включая использование инструментов и взаимодействие с API в стандартизированных сценариях.
- When to use
- Сравнение нескольких агентов перед внедрением или отслеживание регрессий качества между версиями моделей и интеграциями инструментов.
- Watch out
- Оценки бенчмарка не предсказывают качество в реальных условиях; ваши настоящие задачи могут заметно отличаться от 42 тестовых сценариев.
Loading technique guide…