Loading...
Optimisation simple des préférences(SimPO)
Optimisation des préférences sans modèle de référence utilisant la log-probabilité de séquence normalisée par la longueur comme récompense implicite, avec une marge de récompense cible
In 30 seconds
- What
- Entraîne un modèle à préférer les réponses retenues aux réponses rejetées en comparant des log-probabilités normalisées par la longueur, sans nécessiter de modèle de référence distinct.
- When to use
- Vous disposez de données de préférence appariées (réponses retenues et rejetées) et souhaitez optimiser le comportement du modèle sans le coût de calcul lié au maintien d'un modèle de référence.
- Watch out
- La normalisation par la longueur peut masquer les différences de qualité lorsque les réponses retenues et rejetées diffèrent nettement en longueur, ce qui dégrade le signal de préférence.
Loading technique guide…