Loading...
Модели вознаграждения процесса и поиск под управлением верификатора(PRM)
Использует модель вознаграждения, которая оценивает каждый промежуточный шаг рассуждения (надзор за процессом), а не только итоговый ответ (надзор за результатом). Оценки по шагам ранжируют и отсекают кандидатные решения при сэмплировании best-of-N или поиске по дереву, сосредотачивая вычисления во время вывода на наиболее перспективных ветвях и на более сложных задачах.
In 30 seconds
- What
- Оценивает каждый шаг рассуждения с помощью обученной модели, а затем рано отсекает низкооценённые ветви решения во время поиска или сэмплирования.
- When to use
- Многошаговые задачи, где важна корректность промежуточных шагов, вычисления на этапе вывода гибкие, и вы можете позволить себе обучить пошаговый верификатор.
- Watch out
- Качество модели вознаграждения за процесс напрямую ограничивает точность отсечения; плохие оценки шагов тратят вычисления впустую или преждевременно обрубают верные пути.
Loading technique guide…