正在加载模式…
评估驱动开发(智能体 CI)(EDD)
一种开发生命周期方法,即首先针对 eval(评估)来构建智能体和提示词。精心整理的黄金数据集(约 50 到 500 个用例,向已知失败模式倾斜)与提示词一同进行版本控制,在每个拉取请求上作为回归测试套件运行,合并或晋级则以指标阈值作为门槛。该流水线会固定模型和评判器(judge)的版本,因此提供方一侧对模型的静默更新会被检测为回归,而不会被悄然吸收;它还将检查分阶段编排为先 lint、再离线 eval、最后成本门,然后变更才能合并。它区别于 agent-observability-tracing(那是运行时遥测,而非合并前的门控),也区别于固定的公开基准测试(那些并非团队在 CI 中自有的回归套件)。
30秒速览
- 是什么
- 把纳入版本控制的黄金数据集作为回归套件,在每个 PR 上运行,并在锁定模型与评判版本的前提下,以指标阈值卡住合并。
- 何时使用
- 持续交付智能体的团队,需要察觉模型的静默更新、对已知失效模式保持持续覆盖,并让提示词改动经得起可量化的验证。
- 注意
- 黄金数据集若不主动维护、不向当前的失效模式加权,就会过时,或与线上真实故障脱节。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
评估驱动开发(智能体 CI): 概览
一种开发生命周期方法,即首先针对 eval(评估)来构建智能体和提示词。精心整理的黄金数据集(约 50 到 500 个用例,向已知失败模式倾斜)与提示词一同进行版本控制,在每个拉取请求上作为回归测试套件运行,合并或晋级则以指标阈值作为门槛。该流水线会固定模型和评判器(judge)的版本,因此提供方一侧对模型的静默更新会被检测为回归,而不会被悄然吸收;它还将检查分阶段编排为先 lint、再离线 eval、最后成本门,然后变更才能合并。它区别于 agent-observability-tracing(那是运行时遥测,而非合并前的门控),也区别于固定的公开基准测试(那些并非团队在 CI 中自有的回归套件)。
- Version-controlled golden datasets (~50-500 cases) weighted toward known failure modes
- Regression suite runs on every pull request; merge gated on metric thresholds
- Pinned model and judge versions so silent provider updates surface as regressions
- Staged CI pipeline: lint, then offline eval, then cost gate before merge
- LLM-as-judge and code-based scorers combined per failure dimension
- Prompt and dataset changes reviewed together as a single diff
获取智能体评估实战指南
25 种智能体评估方法浓缩成一份指南:每个基准测量什么、公开分数何时具有误导性、如何用自己的失败构建评估。链接随确认邮件送达,并附每周的 The Agent Architect。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
看看你的评测漏掉了什么
评测智能体比做出来更难,多数测试套件一路全绿,线上却在悄悄漂移。我们从头到尾检查你的评测体系:现在测到了什么、还有什么看不见,以及当前套件会放过哪些回归。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前