モデルアーキテクチャ
敵対的生成ネットワーク(GAN)
生成器を識別器を欺くように訓練し、識別器は生成されたサンプルと訓練データを区別するように学習します。
理解のためのモデル
偽造者と批評家がお互いに改善し合い、訓練後、偽造者は1回の順伝播で生成できます。
データフロー
- ランダム潜在変数 + 条件付け
- 生成器
- 合成サンプル
- 識別器が実データと合成サンプルを比較
- 競合的な勾配が両ネットワークを更新
学習方法
ミニマックス敵対的目標関数が2つのネットワークを結びつけます。実践的なバリエーションでは、損失、正則化、正規化、条件付けを変更して訓練の安定化と出力制御を行います。
推論の実行方法
潜在変数をサンプリングし、生成器を1回実行することで、高速な生成が可能になります。インバージョンや編集には、組み込みの反復逆プロセスがないため、追加の機構が必要です。
強み
- 高速なワンパスサンプリング
- 限定された視覚ドメインにおけるシャープな出力
- 有用な条件付きおよび画像から画像へのバリエーション
トレードオフ
- 訓練の不安定性とモード崩壊
- カバレッジと尤度は評価が困難
- 大規模なオープンなテキスト条件付き生成は他のファミリーへと移行しています
適する場合
- 低遅延サンプリングが制約されたドメインで重要である場合
- 実績のあるGANパイプラインがデータに適合し、制御可能である場合
- 多様性とカバレッジを明示的に評価する場合
避ける・再検討する場合
- 安定した訓練と広範なモードカバレッジが主な要件である場合
- チームがドメイン固有の評価を行わない場合
- より新しい拡散モデルや自己回帰ベースラインと比較していない場合
公開された方式の例
- • オリジナルのGANフォーミュレーション
- • StyleGAN研究ファミリー
- • 条件付き画像から画像へのGAN
よく組み合わせる要素
ConvolutionalまたはTransformer生成器インバージョンと編集のためのエンコーダ