Loading...
RL à partir de récompenses vérifiables (RLVR)
Entraîne des modèles de raisonnement par apprentissage par renforcement à partir de récompenses vérifiables automatiquement (par exemple si une réponse mathématique correspond à la vérité de terrain ou si du code passe ses tests) plutôt qu'à partir de modèles de préférence appris. Comme la récompense n'évalue que la justesse finale, de longues chaînes de raisonnement avec retours en arrière et auto-vérification émergent sans justifications supervisées. Cette approche se distingue de RLHF, RLAIF et DPO, qui optimisent des préférences humaines ou d'IA.
In 30 seconds
- What
- Entraîne un modèle par RL avec des récompenses vérifiables automatiquement (exactitude mathématique, tests de code) portant uniquement sur les sorties finales, ce qui laisse émerger des chaînes de raisonnement et une autovérification sans justifications supervisées.
- When to use
- Des problèmes dont la réponse de référence est déterministe et vérifiable, quand vous voulez que le modèle découvre lui-même son processus de raisonnement sans solutions annotées étape par étape.
- Watch out
- Exige énormément de calcul pour échantillonner de nombreuses solutions candidates par problème ; la plupart échouent, ce qui rend l'entraînement coûteux et lent face aux approches supervisées.
Loading technique guide…