Loading...
RL aus verifizierbaren Belohnungen (RLVR)
Trainiert Reasoning-Modelle mit Reinforcement Learning anhand automatisch überprüfbarer Belohnungen (etwa ob eine mathematische Antwort mit der Ground Truth übereinstimmt oder Code seine Tests besteht) statt anhand gelernter Präferenzmodelle. Da die Belohnung nur die endgültige Korrektheit bewertet, entstehen lange Gedankenketten mit Backtracking und Selbstüberprüfung ohne überwachte Begründungen. Dies unterscheidet sich von RLHF, RLAIF und DPO, die menschliche oder KI-Präferenzen optimieren.
In 30 seconds
- What
- Trainiert ein Modell mit RL anhand automatisch prüfbarer Rewards (mathematische Korrektheit, Code-Tests) nur auf den finalen Ausgaben, sodass Argumentationsketten und Selbstprüfung ohne überwachte Begründungen entstehen.
- When to use
- Aufgaben mit deterministischer, überprüfbarer Musterlösung, bei denen das Modell seinen eigenen Denkweg ohne annotierte Schritt-für-Schritt-Lösungen finden soll.
- Watch out
- Erfordert enorme Rechenleistung, um pro Aufgabe viele Lösungskandidaten zu sampeln; die meisten scheitern, was das Training im Vergleich zu überwachten Ansätzen teuer und langsam macht.
Loading technique guide…