モデルアーキテクチャ
潜在拡散モデル
自己符号化器の低次元潜在空間で拡散プロセスを実行し、生成された表現をピクセルまたは別の信号にデコードします。
理解のためのモデル
すべての生データピクセルではなく、コンパクトな学習済みスケッチをノイズ除去します。
データフロー
- トレーニング用メディア
- フローズンまたは共同訓練された自己符号化器潜在空間
- 条件付き潜在ノイズ除去器
- サンプリングされたクリーンな潜在表現
- デコーダ → メディア
学習方法
まず自己符号化器が知覚的な圧縮を学習します。その後、拡散モデルは、多くの場合クロスアテンションを通じて条件付けされながら、その潜在空間上でノイズ除去の目的を学習します。
推論の実行方法
いくつかのステップで小さな潜在テンソルをサンプリングし、最後にデコードします。画像から画像への変換やインペインティングは、エンコードされた選択的にノイズが加えられたソースコンテンツから開始できます。
強み
- 生データの高解像度ピクセルよりも低コストなノイズ除去
- モジュール式テキスト条件付けと編集
- 再利用可能な自己符号化器および生成器コンポーネント
トレードオフ
- 自己符号化器は再構成の上限を作成する
- テキストや高周波ディテールが圧縮によって失われる可能性がある
- 二段階の失敗の原因特定は困難
適する場合
- 高解像度メディアの生成に実用的な計算要件を満たす必要がある
- 編集と条件付き制御が必要な場合
- コーデックによる再構成がターゲットドメインで検証されている場合
避ける・再検討する場合
- 自己符号化器がタスクにとって重要な詳細を落としてしまう
- エンドツーエンドのシンプルさが生成コストよりも重要である場合
- 潜在空間におけるショートカットが安全性に関わるコンテンツを隠してしまう可能性がある場合
公開された方式の例
- • 潜在拡散モデル
- • Stable Diffusion研究系統樹
よく組み合わせる要素
自己符号化器、VAE および学習済みトークナイザーU-Net ノイズ除去器拡散Transformer(DiT)テキストエンコーダ