Loading...
Optimisation des préférences par rapport de cotes(ORPO)
Alignement de préférences sans modèle de référence qui ajoute, à l'objectif de modélisation du langage sur la réponse choisie, une pénalité de rapport de cotes pour les réponses rejetées
In 30 seconds
- What
- Entraîne un modèle sur les réponses retenues tout en pénalisant les réponses rejetées via une perte de rapport de cotes, en se passant totalement du modèle de référence.
- When to use
- Vous disposez de données de préférence appariées et souhaitez un alignement plus rapide et moins coûteux, sans maintenir de modèle de référence distinct.
- Watch out
- La pénalité de rapport de cotes peut déstabiliser l'entraînement si lambda est mal réglé ; une recherche d'hyperparamètres soignée est nécessaire pour éviter une perte de capacités.
Loading technique guide…