Loading...
🪜
プロセス報酬モデルと検証器ガイド探索(PRM)
最終的な答えのみ(結果に基づく監督)ではなく、推論の各中間ステップを評価する報酬モデル(プロセスに基づく監督)を用いる。ステップごとのスコアは、best-of-N サンプリングや木探索の際に候補解をランク付けして枝刈りし、推論時の計算を最も有望な分岐やより難しい問題に集中させる。
複雑さ: high学習と適応
In 30 seconds
- What
- 学習済みモデルで推論の各ステップを採点し、探索やサンプリングの早い段階でスコアの低い解の分岐を枝刈りする。
- When to use
- 中間段階の正しさが重要で、推論時の計算量を柔軟に調整でき、ステップ単位の検証器を学習させる余裕がある多段階の問題。
- Watch out
- プロセス報酬モデルの品質がそのまま枝刈り精度の上限になる。ステップのスコアが粗いと計算資源を浪費したり、正しい経路を早すぎる段階で切り捨てたりする。
Loading technique guide…