Loading...
直接偏好优化(DPO)
对被采纳和被拒绝的响应采用分类损失进行离线偏好优化,无需训练显式的奖励模型
In 30 seconds
- What
- 以冻结的参考策略为基准,通过最小化比较优选与劣选回复的分类损失,直接在偏好对上训练策略,跳过显式的奖励建模。
- When to use
- 你已有成对的偏好数据(优选与劣选输出),希望在不先训练独立奖励模型的开销下完成行为对齐。
- Watch out
- 策略可能大幅偏离参考模型,导致在偏好数据集之外的任务上性能下降;若偏好对过于狭窄,还可能引发模式坍塌。
Loading technique guide…