Loading...
シンプル選好最適化(SimPO)
系列の長さで正規化した対数確率を暗黙的な報酬として用い、目標とする報酬マージンを設定する、参照モデル不要の選好最適化手法
In 30 seconds
- What
- 長さで正規化した対数確率を比較することで、選択された応答を棄却された応答よりも好むようモデルを学習させる。別途の参照モデルを必要としない。
- When to use
- ペアになった選好データ(選択された応答と棄却された応答)があり、参照モデルを維持する計算コストをかけずにモデルの挙動を最適化したい場合。
- Watch out
- 選択された応答と棄却された応答の長さが大きく異なる場合、長さの正規化が品質差を覆い隠し、選好シグナルを劣化させることがある。
Loading technique guide…