Loading...
🏅
基于可验证奖励的强化学习(RLVR)(RLVR)
使用强化学习针对可自动校验的奖励来训练推理模型,例如数学答案是否与标准答案一致或代码是否通过测试,而非针对学习得到的偏好模型。由于奖励只评估最终的正确性,因此无需有监督的推理依据,便会涌现出带有回溯和自我验证的长思维链。这与优化人类或AI偏好的RLHF、RLAIF和DPO不同。
复杂度: high学习与适应
In 30 seconds
- What
- 仅对最终输出使用可自动校验的奖励(数学正确性、代码测试)以强化学习训练模型,让推理链和自我验证在没有监督式解题过程的情况下自发涌现。
- When to use
- 标准答案确定且可验证的问题,且你希望模型在没有逐步标注解法的情况下自行发现推理过程。
- Watch out
- 需要巨量算力为每道题采样大量候选解;其中多数都是错的,因而训练比监督方法更昂贵、更缓慢。
Loading technique guide…