パターンを読み込んでいます…
シンプル選好最適化(SimPO)
系列の長さで正規化した対数確率を暗黙的な報酬として用い、目標とする報酬マージンを設定する、参照モデル不要の選好最適化手法
30秒でわかる概要
- 概要
- 長さで正規化した対数確率を比較することで、選択された応答を棄却された応答よりも好むようモデルを学習させる。別途の参照モデルを必要としない。
- 使いどころ
- ペアになった選好データ(選択された応答と棄却された応答)があり、参照モデルを維持する計算コストをかけずにモデルの挙動を最適化したい場合。
- 注意点
- 選択された応答と棄却された応答の長さが大きく異なる場合、長さの正規化が品質差を覆い隠し、選好シグナルを劣化させることがある。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
シンプル選好最適化: 概要
系列の長さで正規化した対数確率を暗黙的な報酬として用い、目標とする報酬マージンを設定する、参照モデル不要の選好最適化手法
- Reference-model-free training
- Length-normalized implicit reward
- Target reward margin
- Pairwise preference objective
- Sequence-level likelihood comparison
- Length and quality monitoring
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで