正在加载模式…
简单偏好优化(SimPO)
一种无需参考模型的偏好优化方法,将按长度归一化的序列对数概率作为隐式奖励,并设定目标奖励间隔
30秒速览
- 是什么
- 通过比较经长度归一化的对数概率,训练模型偏好被选中的回答而非被拒绝的回答,且无需单独的参考模型。
- 何时使用
- 你拥有成对的偏好数据(被选中与被拒绝的回答),并希望在不付出维护参考模型算力成本的前提下优化模型行为。
- 注意
- 当被选中与被拒绝的回答长度差异较大时,长度归一化可能掩盖质量差异,削弱偏好信号。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
简单偏好优化: 概览
一种无需参考模型的偏好优化方法,将按长度归一化的序列对数概率作为隐式奖励,并设定目标奖励间隔
- Reference-model-free training
- Length-normalized implicit reward
- Target reward margin
- Pairwise preference objective
- Sequence-level likelihood comparison
- Length and quality monitoring
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前