Loading...
基于人类反馈的强化学习(RLHF)
使用强化学习针对从人类偏好判断中学习到的奖励模型对策略进行微调
In 30 seconds
- What
- 从人类偏好比较中训练奖励模型,再依据该模型优化智能体行为,同时约束其相对基线的漂移。
- When to use
- 当简单指标失效,需要让智能体输出对齐细腻的人类价值观,且你负担得起大量人工标注与算力时。
- Watch out
- 奖励模型会学到评审者的偏见,且对边界情形建模不佳;智能体转而钻模型的空子而非真正改进,因此需要昂贵的监控。
Loading technique guide…