Loading...
Простая оптимизация предпочтений(SimPO)
Оптимизация предпочтений без опорной модели, использующая нормированную по длине логарифмическую вероятность последовательности как неявную награду с заданным целевым запасом награды
In 30 seconds
- What
- Обучает модель предпочитать выбранные ответы отклонённым, сравнивая нормированные по длине логарифмические вероятности, без отдельной эталонной модели.
- When to use
- У вас есть парные данные предпочтений (выбранные и отклонённые ответы), и вы хотите оптимизировать поведение модели без вычислительных затрат на поддержание эталонной модели.
- Watch out
- Нормировка по длине может маскировать различия в качестве, когда выбранные и отклонённые ответы существенно различаются по длине, ухудшая сигнал предпочтения.
Loading technique guide…