パターンを読み込んでいます…
人間のフィードバックによる強化学習(RLHF)
人間の選好判断から学習した報酬モデルに対して、強化学習でポリシーをファインチューニングする手法
30秒でわかる概要
- 概要
- 人間の選好比較から報酬モデルを学習し、ベースラインからの逸脱を抑えながら、その報酬モデルに沿ってエージェントの振る舞いを最適化する。
- 使いどころ
- 単純な指標では捉えられない微妙な人間の価値観にエージェントの出力を合わせたい、かつ大量の人手アノテーションと計算資源を投じられるとき。
- 注意点
- 報酬モデルはレビュアーのバイアスを取り込み、エッジケースをうまく学習できない。エージェントは本当に改善するのではなくモデルの隙を突くため、コストの高い監視が必要になる。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
人間のフィードバックによる強化学習: 概要
人間の選好判断から学習した報酬モデルに対して、強化学習でポリシーをファインチューニングする手法
- Human preference collection
- Reward model training
- Policy optimization with KL control
- Human-in-the-loop evaluation
- Behavior shaping from comparative judgments
- Reward-hacking monitoring
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで