モデルアーキテクチャ
画像生成と編集
テキストや画像による条件付け、潜在生成器、画像デコーダを組み合わせて、画素を合成または変換します。
理解のためのモデル
単一のネットワークではなくパイプライン:プロンプトエンコーダ → 生成プロセス → 潜在空間/ピクセルデコーダ。制御および安全性の別コンポーネントが含まれる場合が多いです。
データフロー
- テキスト、画像、マスク、またはレイアウトによる条件付け
- 条件エンコーダ
- 潜在拡散、DiT、または自己回帰ジェネレーター
- イメージデコーダ
- 候補画像 + チェック
学習方法
最新のシステムでは、多くの場合、ピクセル空間または圧縮された潜在空間でノイズ除去またはフロー目的関数を学習します。テキストとの整合性はペアデータと条件付けに依存し、オートエンコーダーは別個にトレーニングされることがあります。
推論の実行方法
サンプラーはノイズまたはノイズ化されたソース画像から開始し、反復的に条件の下でそれを改良し、潜在表現をデコードします。シードは再現性を向上させますが、すべての実行パスを決定論的にしません。
強み
- 高品質な自由形式のビジュアルシンセシス
- バリエーション、インペインティング、およびガイド付き編集に対する自然なサポート
- 潜在空間パイプラインにより高解像度生成がより実用的になります
トレードオフ
- 複数のサンプリングステップはレイテンシを追加します
- テキスト、タイポグラフィ、アイデンティティ、および正確な空間的制約には明示的な評価が必要です
- トレーニングデータに関する権利、来歴、および不正使用管理は製品上の懸念事項です
適する場合
- 創造的なアイデア出し、アセットのドラフト作成、または制御された画像変換
- 出力がレビューまたは制限可能
- ビジュアル品質とプロンプトへの適合性が個別に評価される
避ける・再検討する場合
- ピクセル単位の正確なレイアウトが必要
- 出力が実際のイベントまたはアイデンティティの証拠となる場合
- 権利および来歴要件が未解決の場合
公開された方式の例
- • 潜在拡散 / Stable Diffusion 研究系統
- • Diffusion Transformer (DiT) 研究アーキテクチャ
よく組み合わせる要素
潜在拡散モデル拡散Transformer(DiT)画像エンコーダマルチモーダル融合モデル