Loading...
オッズ比選好最適化(ORPO)
選ばれた応答の言語モデリング目的関数に、拒否された応答へのオッズ比ペナルティを加える、参照モデル不要の選好アライメント手法
In 30 seconds
- What
- 選ばれた応答でモデルを学習させつつ、オッズ比損失によって棄却された応答にペナルティを与え、参照モデルを完全に不要にします。
- When to use
- ペアの選好データがあり、別個の参照モデルを維持せずに、より速く安価なアラインメントを行いたい場合。
- Watch out
- ラムダの調整を誤るとオッズ比ペナルティが学習を不安定にします。能力の低下を避けるには、丁寧なハイパーパラメータ探索が必要です。
Loading technique guide…