正在加载模式…
基于人类反馈的强化学习(RLHF)
使用强化学习针对从人类偏好判断中学习到的奖励模型对策略进行微调
30秒速览
- 是什么
- 从人类偏好比较中训练奖励模型,再依据该模型优化智能体行为,同时约束其相对基线的漂移。
- 何时使用
- 当简单指标失效,需要让智能体输出对齐细腻的人类价值观,且你负担得起大量人工标注与算力时。
- 注意
- 奖励模型会学到评审者的偏见,且对边界情形建模不佳;智能体转而钻模型的空子而非真正改进,因此需要昂贵的监控。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
基于人类反馈的强化学习: 概览
使用强化学习针对从人类偏好判断中学习到的奖励模型对策略进行微调
- Human preference collection
- Reward model training
- Policy optimization with KL control
- Human-in-the-loop evaluation
- Behavior shaping from comparative judgments
- Reward-hacking monitoring
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前