Loading...
Eval 駆動開発(エージェント CI)(EDD)
エージェントとプロンプトを、まず eval(評価)に対して構築するという開発ライフサイクルの規律。厳選されたゴールデンデータセット(既知の失敗モードに重み付けした、およそ 50〜500 件のケース)をプロンプトとともにバージョン管理し、プルリクエストごとに回帰テストスイートとして実行し、マージや昇格はメトリクスのしきい値でゲートします。パイプラインはモデルと judge のバージョンを固定するため、プロバイダー側でモデルが黙って更新されても、それがひそかに吸収されるのではなく回帰として検出されます。また、変更をマージできるようになる前に、lint、次にオフライン eval、次にコストゲートという順でチェックを段階的に実行します。実行時のテレメトリであってマージ前のゲートではない agent-observability-tracing とは異なり、また、CI 内でチームが所有する回帰スイートではない固定の公開ベンチマークとも異なります。
In 30 seconds
- What
- バージョン管理されたゴールデンデータセットを、すべてのPRで回帰テストとして実行し、モデルとジャッジのバージョンを固定したうえで、指標のしきい値でマージを制御します。
- When to use
- エージェントを継続的に出荷するチームで、モデルの静かな更新を検知し、既知の失敗モードを継続的にカバーし、プロンプトの変更を測定可能な形で検証する必要がある場合。
- Watch out
- ゴールデンデータセットは、積極的に手入れをし、現在の失敗モードに重みを置かないと、古びて本番の実際の失敗とずれていきます。
Loading technique guide…