Loading...
优势比偏好优化(ORPO)
一种无需参考模型的偏好对齐方法,在针对被选中回复的语言建模目标之外,为被拒绝的回复添加优势比惩罚项
In 30 seconds
- What
- 在被选中的回复上训练模型,同时通过优势比损失惩罚被拒绝的回复,完全省去参照模型。
- When to use
- 你有成对的偏好数据,希望在不维护单独参照模型的前提下,实现更快、更省成本的对齐。
- Watch out
- 若 lambda 调校不当,优势比惩罚会破坏训练稳定性;需要细致的超参数搜索以避免能力退化。
Loading technique guide…