教師ありファインチューニング(SFT)
データ: 入力と期待する出力の例
安定したタスク、応答の構造、文体、ツール呼び出しの型を教えます。
注意点: 手本に含まれる誤りや偏りをそのまま模倣することがあり、無関係な挙動が退行する場合もあります。
2つの選択を分けて考えます。手元のデータに合う学習目的はどれか、そしてモデルのどこまでを更新するかです。あらゆるモデル、タスク、ハードウェアで最良となる手法はありません。
データ: 入力と期待する出力の例
安定したタスク、応答の構造、文体、ツール呼び出しの型を教えます。
注意点: 手本に含まれる誤りや偏りをそのまま模倣することがあり、無関係な挙動が退行する場合もあります。
データ: 好ましい応答と好ましくない応答、または同等のフィードバック
理想の答えを1つ定義するより比較のほうが容易な場面で、選択の傾向を動かします。
注意点: ラベル方針、アノテーター間の一致度、ホールドアウトでの評価は、アルゴリズムと同じくらい重要です。
データ: プロンプトと、信頼できる採点器または報酬シグナル
生成された軌跡を一貫して採点できる成果を最適化します。
注意点: 報酬ハッキング、採点器の偏り、不安定さ、運用の複雑さが増すため、追加の統制が必要です。
ベースの重みを更新し、柔軟性は最も高い一方で、メモリ、保管、ロールバックの負担が最も大きくなります。
アダプター系の手法で計測目標に届かず、インフラとデータがそれを正当化できる場合にのみ検討します。
ベースモデルを凍結し、小さな更新モジュールだけを学習します。成果物は小さく、複数のアダプターが1つのベースを共有できます。
多くのTransformer系ワークロードで最初に試す価値があります。ランクと対象モジュールは実験で決める必要があります。
量子化して凍結したベースを通して逆伝播し、LoRAアダプターを学習します。ベース重みのメモリは減りますが、互換性やスループットを損なう可能性があります。
メモリが最大の制約になっている場合に有効です。量子化の対応状況と、最終的なサービング品質を確認してください。
DoRA、AdaLoRA、LoRA+などの派生手法は、パラメータ化、割り当て、最適化を変えます。実装が対象モデルに対応していて、より単純なベースラインの計測済みの弱点に効く場合にだけ試してください。
QATは低精度で配備した後の品質を狙います。学習時のメモリを抑えるために量子化した凍結ベースを使うQLoRAとは目的が異なります。書き出した形式を、実際に使うランタイムで検証してください。