パターンを読み込んでいます…
検証可能な報酬による強化学習(RLVR)
学習された選好モデルではなく、数学の答えが正解と一致するかやコードがテストを通過するかといった、自動的に検証できる報酬に対して強化学習で推論モデルを訓練する。報酬が最終的な正しさのみを評価するため、教師ありの根拠なしに、バックトラッキングや自己検証を伴う長い思考の連鎖が創発する。これは人間やAIの選好を最適化するRLHF、RLAIF、DPOとは異なる。
30秒でわかる概要
- 概要
- 最終出力だけを対象に、自動で検証できる報酬(数学的な正しさ、コードのテスト)を用いてRLでモデルを学習させ、教師付きの根拠なしに推論の連鎖や自己検証を創発させる。
- 使いどころ
- 正解が決定的で検証可能な問題において、段階ごとにラベル付けされた解法なしに、モデル自身に推論プロセスを発見させたいとき。
- 注意点
- 1問あたり多数の解答候補をサンプリングするために膨大な計算資源が要る。その大半は失敗するため、教師あり手法に比べて学習は高価で遅い。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
検証可能な報酬による強化学習(RLVR): 概要
学習された選好モデルではなく、数学の答えが正解と一致するかやコードがテストを通過するかといった、自動的に検証できる報酬に対して強化学習で推論モデルを訓練する。報酬が最終的な正しさのみを評価するため、教師ありの根拠なしに、バックトラッキングや自己検証を伴う長い思考の連鎖が創発する。これは人間やAIの選好を最適化するRLHF、RLAIF、DPOとは異なる。
- Automatically verifiable rewards (math or code correctness)
- No supervised reasoning traces required
- Emergent long chain-of-thought with backtracking
- Emergent self-verification and re-checking
- Group-relative policy optimization (GRPO)
- Distinct from preference-based RLHF, RLAIF, and DPO
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで