Loading...
人間のフィードバックによる強化学習(RLHF)
人間の選好判断から学習した報酬モデルに対して、強化学習でポリシーをファインチューニングする手法
In 30 seconds
- What
- 人間の選好比較から報酬モデルを学習し、ベースラインからの逸脱を抑えながら、その報酬モデルに沿ってエージェントの振る舞いを最適化する。
- When to use
- 単純な指標では捉えられない微妙な人間の価値観にエージェントの出力を合わせたい、かつ大量の人手アノテーションと計算資源を投じられるとき。
- Watch out
- 報酬モデルはレビュアーのバイアスを取り込み、エッジケースをうまく学習できない。エージェントは本当に改善するのではなくモデルの隙を突くため、コストの高い監視が必要になる。
Loading technique guide…