Loading...
Optimisation directe des préférences(DPO)
Optimisation hors ligne des préférences avec une fonction de perte de classification sur les réponses retenues et rejetées, sans entraîner de modèle de récompense explicite
In 30 seconds
- What
- Entraîne une politique directement sur des paires de préférences en minimisant une perte de classification qui compare les réponses choisies et rejetées par rapport à une politique de référence figée, en évitant toute modélisation explicite de la récompense.
- When to use
- Vous disposez de données de préférence appariées (sorties choisies et rejetées) et voulez aligner le comportement sans le surcoût d'entraîner d'abord un modèle de récompense distinct.
- Watch out
- La politique peut s'éloigner fortement de la référence, dégradant les performances sur les tâches hors du jeu de préférences ou provoquant un effondrement de modes si les paires sont trop étroites.
Loading technique guide…