Loading...
Eval-getriebene Entwicklung (Agent-CI)(EDD)
Die Disziplin im Entwicklungslebenszyklus, Agenten und Prompts zuerst gegen Evals zu bauen. Sorgfältig kuratierte Golden-Datasets (etwa 50 bis 500 Fälle, gewichtet nach bekannten Fehlermodi) werden zusammen mit den Prompts versioniert, bei jedem Pull Request als Regressionssuite ausgeführt, und Merge oder Promotion sind an Metrik-Schwellenwerte gebunden. Die Pipeline fixiert die Versionen von Modell und Judge, sodass ein stilles modellseitiges Update aufseiten des Anbieters als Regression erkannt statt unbemerkt übernommen wird, und staffelt ihre Prüfungen als Lint, dann Offline-Eval, dann ein Kosten-Gate, bevor eine Änderung gemergt werden kann. Zu unterscheiden von agent-observability-tracing, das Laufzeit-Telemetrie und kein Gate vor dem Merge ist, und von festen öffentlichen Benchmarks, die keine teameigenen Regressionssuiten in der CI sind.
In 30 seconds
- What
- Versionierte Golden Datasets laufen bei jedem PR als Regressionssuiten und machen den Merge von Metrik-Schwellenwerten abhängig, mit fest gepinnten Modell- und Judge-Versionen.
- When to use
- Teams, die Agenten ausliefern und dabei stille Modell-Updates erkennen, bekannte Fehlermodi durchgehend abdecken und Prompt-Änderungen messbar validieren müssen.
- Watch out
- Golden Datasets veralten oder passen nicht mehr zu den echten Produktionsfehlern, wenn sie nicht aktiv gepflegt und auf die aktuellen Fehlermodi gewichtet werden.
Loading technique guide…