パターンを読み込んでいます…
オッズ比選好最適化(ORPO)
選ばれた応答の言語モデリング目的関数に、拒否された応答へのオッズ比ペナルティを加える、参照モデル不要の選好アライメント手法
30秒でわかる概要
- 概要
- 選ばれた応答でモデルを学習させつつ、オッズ比損失によって棄却された応答にペナルティを与え、参照モデルを完全に不要にします。
- 使いどころ
- ペアの選好データがあり、別個の参照モデルを維持せずに、より速く安価なアラインメントを行いたい場合。
- 注意点
- ラムダの調整を誤るとオッズ比ペナルティが学習を不安定にします。能力の低下を避けるには、丁寧なハイパーパラメータ探索が必要です。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
オッズ比選好最適化: 概要
選ばれた応答の言語モデリング目的関数に、拒否された応答へのオッズ比ペナルティを加える、参照モデル不要の選好アライメント手法
- Reference-model-free training
- Chosen-response SFT objective
- Odds-ratio preference penalty
- Single training phase
- Paired preference data
- Preference and capability evaluation
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで