Loading...
🏅
検証可能な報酬による強化学習(RLVR)(RLVR)
学習された選好モデルではなく、数学の答えが正解と一致するかやコードがテストを通過するかといった、自動的に検証できる報酬に対して強化学習で推論モデルを訓練する。報酬が最終的な正しさのみを評価するため、教師ありの根拠なしに、バックトラッキングや自己検証を伴う長い思考の連鎖が創発する。これは人間やAIの選好を最適化するRLHF、RLAIF、DPOとは異なる。
複雑さ: high学習と適応
In 30 seconds
- What
- 最終出力だけを対象に、自動で検証できる報酬(数学的な正しさ、コードのテスト)を用いてRLでモデルを学習させ、教師付きの根拠なしに推論の連鎖や自己検証を創発させる。
- When to use
- 正解が決定的で検証可能な問題において、段階ごとにラベル付けされた解法なしに、モデル自身に推論プロセスを発見させたいとき。
- Watch out
- 1問あたり多数の解答候補をサンプリングするために膨大な計算資源が要る。その大半は失敗するため、教師あり手法に比べて学習は高価で遅い。
Loading technique guide…