Loading...
Обучение с подкреплением на проверяемых наградах (RLVR)
Обучает модели рассуждения с помощью обучения с подкреплением на автоматически проверяемых наградах (например, совпадает ли математический ответ с эталоном или проходит ли код свои тесты), а не на обученных моделях предпочтений. Поскольку награда оценивает только итоговую правильность, длинные цепочки рассуждений с возвратами и самопроверкой возникают без размеченных обоснований. Это отличается от RLHF, RLAIF и DPO, которые оптимизируют предпочтения человека или ИИ.
In 30 seconds
- What
- Обучает модель методом RL по автоматически проверяемым наградам (правильность математики, тесты кода), выставляемым только за конечный ответ, благодаря чему цепочки рассуждений и самопроверка возникают без размеченных обоснований.
- When to use
- Задачи с детерминированным, проверяемым эталонным ответом, где вы хотите, чтобы модель сама нашла свой способ рассуждения без размеченных пошаговых решений.
- Watch out
- Требует огромных вычислений, чтобы сэмплировать множество кандидатных решений на каждую задачу; большинство из них неверны, что делает обучение дорогим и медленным по сравнению с обучением с учителем.
Loading technique guide…