Muster werden geladen…
Prozess-Belohnungsmodelle & verifizierergesteuerte Suche(PRM)
Verwendet ein Belohnungsmodell, das jeden Zwischenschritt der Argumentation bewertet (Prozessüberwachung) statt nur die endgültige Antwort (Ergebnisüberwachung). Die Bewertungen pro Schritt ordnen und beschneiden Kandidatenlösungen beim Best-of-N-Sampling oder der Baumsuche und konzentrieren die Rechenleistung zur Testzeit auf die vielversprechendsten Zweige und auf schwierigere Probleme.
In 30 Sekunden
- Was
- Bewertet jeden Argumentationsschritt mit einem gelernten Modell und beschneidet schlecht bewertete Lösungszweige früh während Suche oder Sampling.
- Wann einsetzen
- Mehrstufige Probleme, bei denen die Korrektheit von Zwischenschritten zählt, die Rechenzeit zur Inferenzzeit flexibel ist und Sie sich das Training eines schrittweisen Verifizierers leisten können.
- Achtung
- Die Qualität des Process Reward Model begrenzt direkt die Genauigkeit des Prunings; schlechte Schrittbewertungen verschwenden Rechenleistung oder kappen korrekte Pfade vorzeitig.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Prozess-Belohnungsmodelle & verifizierergesteuerte Suche: Überblick
Verwendet ein Belohnungsmodell, das jeden Zwischenschritt der Argumentation bewertet (Prozessüberwachung) statt nur die endgültige Antwort (Ergebnisüberwachung). Die Bewertungen pro Schritt ordnen und beschneiden Kandidatenlösungen beim Best-of-N-Sampling oder der Baumsuche und konzentrieren die Rechenleistung zur Testzeit auf die vielversprechendsten Zweige und auf schwierigere Probleme.
- Per-step correctness scoring (process supervision)
- Ranks and prunes candidates in best-of-N or tree search
- Early pruning of low-scoring branches
- Compute-optimal allocation by problem difficulty
- More sample-efficient than outcome-only reward models
- Verifier-guided selection of the final answer
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihre Agenten-Architektur prüfen
Diese Seite dokumentiert ein Pattern. Ihr System betreibt Dutzende, und die meisten Ausfälle entstehen im Zusammenspiel. Lassen Sie den gesamten Entwurf an den 288 Patterns dieses Katalogs messen: Architektur, Zuverlässigkeit, Evaluation und Kosten, jeder Befund verknüpft mit dem Pattern, das ihn behebt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September