Loading...
Оптимизация предпочтений по отношению шансов(ORPO)
Выравнивание предпочтений без опорной модели, добавляющее к языковой цели для выбранного ответа штраф на основе отношения шансов для отклонённых ответов
In 30 seconds
- What
- Обучает модель на выбранных ответах, одновременно штрафуя отклонённые ответы через функцию потерь на основе отношения шансов, полностью обходясь без референсной модели.
- When to use
- У вас есть парные данные предпочтений и нужно более быстрое и дешёвое выравнивание без отдельной референсной модели.
- Watch out
- Штраф на основе отношения шансов может дестабилизировать обучение при неверно подобранной лямбде; чтобы не потерять способности модели, нужен тщательный поиск гиперпараметров.
Loading technique guide…