Loading...
Prozess-Belohnungsmodelle & verifizierergesteuerte Suche(PRM)
Verwendet ein Belohnungsmodell, das jeden Zwischenschritt der Argumentation bewertet (Prozessüberwachung) statt nur die endgültige Antwort (Ergebnisüberwachung). Die Bewertungen pro Schritt ordnen und beschneiden Kandidatenlösungen beim Best-of-N-Sampling oder der Baumsuche und konzentrieren die Rechenleistung zur Testzeit auf die vielversprechendsten Zweige und auf schwierigere Probleme.
In 30 seconds
- What
- Bewertet jeden Argumentationsschritt mit einem gelernten Modell und beschneidet schlecht bewertete Lösungszweige früh während Suche oder Sampling.
- When to use
- Mehrstufige Probleme, bei denen die Korrektheit von Zwischenschritten zählt, die Rechenzeit zur Inferenzzeit flexibel ist und Sie sich das Training eines schrittweisen Verifizierers leisten können.
- Watch out
- Die Qualität des Process Reward Model begrenzt direkt die Genauigkeit des Prunings; schlechte Schrittbewertungen verschwenden Rechenleistung oder kappen korrekte Pfade vorzeitig.
Loading technique guide…