Loading...
简单偏好优化(SimPO)
一种无需参考模型的偏好优化方法,将按长度归一化的序列对数概率作为隐式奖励,并设定目标奖励间隔
In 30 seconds
- What
- 通过比较经长度归一化的对数概率,训练模型偏好被选中的回答而非被拒绝的回答,且无需单独的参考模型。
- When to use
- 你拥有成对的偏好数据(被选中与被拒绝的回答),并希望在不付出维护参考模型算力成本的前提下优化模型行为。
- Watch out
- 当被选中与被拒绝的回答长度差异较大时,长度归一化可能掩盖质量差异,削弱偏好信号。
Loading technique guide…