パターンを読み込んでいます…
プロセス報酬モデルと検証器ガイド探索(PRM)
最終的な答えのみ(結果に基づく監督)ではなく、推論の各中間ステップを評価する報酬モデル(プロセスに基づく監督)を用いる。ステップごとのスコアは、best-of-N サンプリングや木探索の際に候補解をランク付けして枝刈りし、推論時の計算を最も有望な分岐やより難しい問題に集中させる。
30秒でわかる概要
- 概要
- 学習済みモデルで推論の各ステップを採点し、探索やサンプリングの早い段階でスコアの低い解の分岐を枝刈りする。
- 使いどころ
- 中間段階の正しさが重要で、推論時の計算量を柔軟に調整でき、ステップ単位の検証器を学習させる余裕がある多段階の問題。
- 注意点
- プロセス報酬モデルの品質がそのまま枝刈り精度の上限になる。ステップのスコアが粗いと計算資源を浪費したり、正しい経路を早すぎる段階で切り捨てたりする。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
プロセス報酬モデルと検証器ガイド探索: 概要
最終的な答えのみ(結果に基づく監督)ではなく、推論の各中間ステップを評価する報酬モデル(プロセスに基づく監督)を用いる。ステップごとのスコアは、best-of-N サンプリングや木探索の際に候補解をランク付けして枝刈りし、推論時の計算を最も有望な分岐やより難しい問題に集中させる。
- Per-step correctness scoring (process supervision)
- Ranks and prunes candidates in best-of-N or tree search
- Early pruning of low-scoring branches
- Compute-optimal allocation by problem difficulty
- More sample-efficient than outcome-only reward models
- Verifier-guided selection of the final answer
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで