正在加载模式…
🪜
过程奖励模型与验证器引导搜索(PRM)
使用一种奖励模型,为推理的每一个中间步骤打分(过程监督),而不仅仅评估最终答案(结果监督)。这些逐步分数在 best-of-N 采样或树搜索中对候选解进行排序和剪枝,将测试时的计算集中在最有希望的分支和更难的问题上。
复杂度: high学习与适应
30秒速览
- 是什么
- 用训练好的模型为每一个推理步骤打分,然后在搜索或采样的早期剪掉得分低的解分支。
- 何时使用
- 中间步骤的正确性很重要、推理时算力可以灵活调配,并且你有条件训练步骤级验证器的多步问题。
- 注意
- 过程奖励模型的质量直接决定剪枝精度的上限;步骤打分不准会浪费算力,或者过早砍掉正确的路径。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
过程奖励模型与验证器引导搜索: 概览
使用一种奖励模型,为推理的每一个中间步骤打分(过程监督),而不仅仅评估最终答案(结果监督)。这些逐步分数在 best-of-N 采样或树搜索中对候选解进行排序和剪枝,将测试时的计算集中在最有希望的分支和更难的问题上。
- Per-step correctness scoring (process supervision)
- Ranks and prunes candidates in best-of-N or tree search
- Early pruning of low-scoring branches
- Compute-optimal allocation by problem difficulty
- More sample-efficient than outcome-only reward models
- Verifier-guided selection of the final answer
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前