Loading...
基于AI反馈的强化学习(RLAIF)
在人类定义的标准和监督下,利用AI评估器生成的偏好判断来训练策略
In 30 seconds
- What
- 利用按人类设定标准运行的 AI 评估器给出的偏好判断来训练策略,并通过人工审计发现评估器漂移。
- When to use
- 需要把偏好标注扩展到超出人力承受的规模,同时在特定任务上保持与人类价值观的一致。
- Watch out
- AI 评估器可能悄然偏离评分标准,或放大校准集中固有的人类偏见,从而污染整轮训练。
Loading technique guide…