Loading...
Modèles de récompense de processus et recherche guidée par vérificateur(PRM)
Utilise un modèle de récompense qui évalue chaque étape intermédiaire du raisonnement (supervision du processus) plutôt que la seule réponse finale (supervision du résultat). Les scores par étape classent et élaguent les solutions candidates lors d'un échantillonnage best-of-N ou d'une recherche arborescente, concentrant le calcul au moment du test sur les branches les plus prometteuses et sur les problèmes les plus difficiles.
In 30 seconds
- What
- Note chaque étape de raisonnement à l'aide d'un modèle appris, puis élague très tôt les branches de solution mal notées pendant la recherche ou l'échantillonnage.
- When to use
- Problèmes à plusieurs étapes où la justesse intermédiaire compte, où le calcul au moment de l'inférence est flexible et où vous pouvez vous permettre d'entraîner un vérificateur au niveau des étapes.
- Watch out
- La qualité du modèle de récompense de processus limite directement la précision de l'élagage ; de mauvaises notes d'étape gaspillent du calcul ou coupent prématurément des chemins corrects.
Loading technique guide…