パターンを読み込んでいます…
直接選好最適化(DPO)
採用された応答と却下された応答に対する分類損失を用いたオフラインの選好最適化で、明示的な報酬モデルを学習させずに行う手法
30秒でわかる概要
- 概要
- 凍結した参照ポリシーを基準に、採用された応答と却下された応答を比較する分類損失を最小化することで、選好ペアから直接ポリシーを学習し、明示的な報酬モデリングを省く。
- 使いどころ
- 対になった選好データ(採用された出力と却下された出力)があり、別個の報酬モデルを先に訓練する手間をかけずに振る舞いを整合させたいとき。
- 注意点
- ポリシーが参照から大きく乖離し、選好データセット外のタスクで性能が落ちたり、選好ペアが偏っているとモード崩壊を招いたりする。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
直接選好最適化: 概要
採用された応答と却下された応答に対する分類損失を用いたオフラインの選好最適化で、明示的な報酬モデルを学習させずに行う手法
- Chosen and rejected response pairs
- Frozen reference policy comparison
- Direct policy optimization
- Log-ratio classification objective
- Offline preference training
- Behavior-drift monitoring
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで