正在加载模式…
直接偏好优化(DPO)
对被采纳和被拒绝的响应采用分类损失进行离线偏好优化,无需训练显式的奖励模型
30秒速览
- 是什么
- 以冻结的参考策略为基准,通过最小化比较优选与劣选回复的分类损失,直接在偏好对上训练策略,跳过显式的奖励建模。
- 何时使用
- 你已有成对的偏好数据(优选与劣选输出),希望在不先训练独立奖励模型的开销下完成行为对齐。
- 注意
- 策略可能大幅偏离参考模型,导致在偏好数据集之外的任务上性能下降;若偏好对过于狭窄,还可能引发模式坍塌。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
直接偏好优化: 概览
对被采纳和被拒绝的响应采用分类损失进行离线偏好优化,无需训练显式的奖励模型
- Chosen and rejected response pairs
- Frozen reference policy comparison
- Direct policy optimization
- Log-ratio classification objective
- Offline preference training
- Behavior-drift monitoring
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前