能力の退行
対象の挙動を良くすると、無関係な能力、確信度の較正、安全性の挙動が損なわれることがあります。
対策: ベースモデルの退行テスト一式を固定して保持し、すべての候補をそれと比較します。
ファインチューニングは実験であり、確実な改善ではありません。問うべきなのは、許容できない退行、漏えい、費用、運用リスクを伴わずに、定義したワークロードを候補が改善するかどうかです。
対象の挙動を良くすると、無関係な能力、確信度の較正、安全性の挙動が損なわれることがあります。
対策: ベースモデルの退行テスト一式を固定して保持し、すべての候補をそれと比較します。
機微な記録、重複した記録、一意に特定できる記録は、学習され再現されることがあります。
対策: データを最小化して重複を除き、来歴を記録し、機密情報と個人データを走査し、抽出テストを実施します。
信頼できない、あるいは十分に確認されていない例は、望ましくない挙動やバックドアを教えてしまうことがあります。
対策: 書き込み権限を制限し、来歴を保持し、異常を確認し、トリガーに似た入力を採用前に検証します。
学習例がテスト事例と重なっている場合や、1つの指標が製品目標の代わりになっている場合、モデルは実際より良く見えます。
対策: 分割をまたいで重複を除き、封をしたホールドアウトを保ち、タスク指標に人手のレビューと安全性レビューを組み合わせます。
オフラインでの改善は、実際の入力、変わっていく方針、別のサービングテンプレートでは維持されないことがあります。
対策: 本番に近いトラフィックで検証し、スライスと回答保留を監視し、ロールバックの閾値を定めます。
提供者やフレームワークによっては、アダプター、オプティマイザの状態、配備可能なチェックポイントを書き出せません。
対策: 学習を始める前に、成果物の所有権、書き出し形式、保存期間、削除、リージョン、ロールバックへの対応を確認します。
これらは手法と根拠を示す資料であり、本番環境で普遍的な結果を保証するものではありません。