Muster werden geladen…
RL aus verifizierbaren Belohnungen (RLVR)
Trainiert Reasoning-Modelle mit Reinforcement Learning anhand automatisch überprüfbarer Belohnungen (etwa ob eine mathematische Antwort mit der Ground Truth übereinstimmt oder Code seine Tests besteht) statt anhand gelernter Präferenzmodelle. Da die Belohnung nur die endgültige Korrektheit bewertet, entstehen lange Gedankenketten mit Backtracking und Selbstüberprüfung ohne überwachte Begründungen. Dies unterscheidet sich von RLHF, RLAIF und DPO, die menschliche oder KI-Präferenzen optimieren.
In 30 Sekunden
- Was
- Trainiert ein Modell mit RL anhand automatisch prüfbarer Rewards (mathematische Korrektheit, Code-Tests) nur auf den finalen Ausgaben, sodass Argumentationsketten und Selbstprüfung ohne überwachte Begründungen entstehen.
- Wann einsetzen
- Aufgaben mit deterministischer, überprüfbarer Musterlösung, bei denen das Modell seinen eigenen Denkweg ohne annotierte Schritt-für-Schritt-Lösungen finden soll.
- Achtung
- Erfordert enorme Rechenleistung, um pro Aufgabe viele Lösungskandidaten zu sampeln; die meisten scheitern, was das Training im Vergleich zu überwachten Ansätzen teuer und langsam macht.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
RL aus verifizierbaren Belohnungen (RLVR): Überblick
Trainiert Reasoning-Modelle mit Reinforcement Learning anhand automatisch überprüfbarer Belohnungen (etwa ob eine mathematische Antwort mit der Ground Truth übereinstimmt oder Code seine Tests besteht) statt anhand gelernter Präferenzmodelle. Da die Belohnung nur die endgültige Korrektheit bewertet, entstehen lange Gedankenketten mit Backtracking und Selbstüberprüfung ohne überwachte Begründungen. Dies unterscheidet sich von RLHF, RLAIF und DPO, die menschliche oder KI-Präferenzen optimieren.
- Automatically verifiable rewards (math or code correctness)
- No supervised reasoning traces required
- Emergent long chain-of-thought with backtracking
- Emergent self-verification and re-checking
- Group-relative policy optimization (GRPO)
- Distinct from preference-based RLHF, RLAIF, and DPO
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihre Agenten-Architektur prüfen
Diese Seite dokumentiert ein Pattern. Ihr System betreibt Dutzende, und die meisten Ausfälle entstehen im Zusammenspiel. Lassen Sie den gesamten Entwurf an den 288 Patterns dieses Katalogs messen: Architektur, Zuverlässigkeit, Evaluation und Kosten, jeder Befund verknüpft mit dem Pattern, das ihn behebt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September