Loading...
🪜
过程奖励模型与验证器引导搜索(PRM)
使用一种奖励模型,为推理的每一个中间步骤打分(过程监督),而不仅仅评估最终答案(结果监督)。这些逐步分数在 best-of-N 采样或树搜索中对候选解进行排序和剪枝,将测试时的计算集中在最有希望的分支和更难的问题上。
复杂度: high学习与适应
In 30 seconds
- What
- 用训练好的模型为每一个推理步骤打分,然后在搜索或采样的早期剪掉得分低的解分支。
- When to use
- 中间步骤的正确性很重要、推理时算力可以灵活调配,并且你有条件训练步骤级验证器的多步问题。
- Watch out
- 过程奖励模型的质量直接决定剪枝精度的上限;步骤打分不准会浪费算力,或者过早砍掉正确的路径。
Loading technique guide…