Loading...
HELM エージェント評価フレームワーク(HELM-AE)
エージェント能力向けに拡張されたStanford CRFMのHolistic Evaluation of Language Models。詳細な実例は過去時点のベンチマークのスナップショットであり、現在のモデル推奨ではない。
In 30 seconds
- What
- 精度、キャリブレーション、堅牢性、公平性、バイアス、有害性、効率という七つの観点でエージェントの性能を測定し、標準化されたシナリオでのツール利用や API 連携も対象とします。
- When to use
- デプロイ前に複数のエージェントを比較したり、モデルのバージョンやツール連携をまたいだ性能の劣化を追跡したりする場面。
- Watch out
- ベンチマークのスコアは実運用での性能を予測しません。実際のタスクは 42 のテストシナリオと大きく異なる可能性があります。
Loading technique guide…