Loading...
Прямая оптимизация предпочтений(DPO)
Офлайн-оптимизация предпочтений с классификационной функцией потерь по выбранным и отклонённым ответам, без обучения явной модели вознаграждения
In 30 seconds
- What
- Обучает политику напрямую на парах предпочтений, минимизируя классификационную функцию потерь, которая сравнивает выбранные и отклонённые ответы относительно замороженной эталонной политики, без явного моделирования вознаграждения.
- When to use
- У вас есть парные данные предпочтений (выбранные и отклонённые выводы), и вы хотите выровнять поведение без накладных расходов на предварительное обучение отдельной модели вознаграждения.
- Watch out
- Политика может сильно уйти от эталонной, ухудшая качество на задачах вне набора предпочтений или вызывая коллапс мод, если пары предпочтений слишком узкие.
Loading technique guide…