Loading...
直接選好最適化(DPO)
採用された応答と却下された応答に対する分類損失を用いたオフラインの選好最適化で、明示的な報酬モデルを学習させずに行う手法
In 30 seconds
- What
- 凍結した参照ポリシーを基準に、採用された応答と却下された応答を比較する分類損失を最小化することで、選好ペアから直接ポリシーを学習し、明示的な報酬モデリングを省く。
- When to use
- 対になった選好データ(採用された出力と却下された出力)があり、別個の報酬モデルを先に訓練する手間をかけずに振る舞いを整合させたいとき。
- Watch out
- ポリシーが参照から大きく乖離し、選好データセット外のタスクで性能が落ちたり、選好ペアが偏っているとモード崩壊を招いたりする。
Loading technique guide…