正在加载模式…
🏅
基于可验证奖励的强化学习(RLVR)
使用强化学习针对可自动校验的奖励来训练推理模型,例如数学答案是否与标准答案一致或代码是否通过测试,而非针对学习得到的偏好模型。由于奖励只评估最终的正确性,因此无需有监督的推理依据,便会涌现出带有回溯和自我验证的长思维链。这与优化人类或AI偏好的RLHF、RLAIF和DPO不同。
复杂度: high学习与适应
30秒速览
- 是什么
- 仅对最终输出使用可自动校验的奖励(数学正确性、代码测试)以强化学习训练模型,让推理链和自我验证在没有监督式解题过程的情况下自发涌现。
- 何时使用
- 标准答案确定且可验证的问题,且你希望模型在没有逐步标注解法的情况下自行发现推理过程。
- 注意
- 需要巨量算力为每道题采样大量候选解;其中多数都是错的,因而训练比监督方法更昂贵、更缓慢。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
基于可验证奖励的强化学习(RLVR): 概览
使用强化学习针对可自动校验的奖励来训练推理模型,例如数学答案是否与标准答案一致或代码是否通过测试,而非针对学习得到的偏好模型。由于奖励只评估最终的正确性,因此无需有监督的推理依据,便会涌现出带有回溯和自我验证的长思维链。这与优化人类或AI偏好的RLHF、RLAIF和DPO不同。
- Automatically verifiable rewards (math or code correctness)
- No supervised reasoning traces required
- Emergent long chain-of-thought with backtracking
- Emergent self-verification and re-checking
- Group-relative policy optimization (GRPO)
- Distinct from preference-based RLHF, RLAIF, and DPO
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前