モデルアーキテクチャ
自己符号化器、VAE および学習済みトークナイザー
データを圧縮するエンコーダと、それを再構成するデコーダを学習します。変分および量子化されたバリエーションは、サンプリングまたは下流生成のために潜在空間を形成します。
理解のためのモデル
学習されたコーデックです。別のモデルが圧縮された空間で生成する前に、どの情報が生き残るかを決定します。
データフロー
- 画像、音声、またはその他の信号
- エンコーダ
- 連続的な潜在変数または離散コード
- オプションの潜在変数ジェネレータ
- デコーダ再構成
学習方法
再構成目的は、知覚的な内容を維持します。VAE には分布正則化を追加し、ベクトル量子化モデルは表現を離散的なコードブックにマッピングし、コードブック/コミットメント目的を追加します。
推論の実行方法
圧縮または編集のためにエンコードします。潜在変数/コードシーケンスをサンプリングまたは生成します。元のモダリティにデコードします。再構成の品質が、可能な最高のダウンストリーム出力に制限されます。
強み
- 高価なメディアの次元削減
- 再利用可能な連続的な潜在変数または離散トークンを作成
- 表現学習と生成的プライアを分離
トレードオフ
- 圧縮は詳細を破棄する
- 潜在変数の幾何学は、下流セマンティクスに一致しない可能性がある
- 量子化されたコードブックが十分に活用されないか、アーチファクトを導入する可能性がある
適する場合
- 元のメディアを直接モデル化することが高価すぎる場合
- 生成モデルにコンパクトな連続または離散空間が必要な場合
- 再構成の失敗はコンテンツスライスで測定される場合
避ける・再検討する場合
- 損失のない再構成が必須の場合
- コーデックドメインが本番データと大きく異なる場合
- デコーダアーチファクトがジェネレータの故障と誤解される可能性がある場合
公開された方式の例
- • 変分オートエンコーダ (VAE)
- • VQ-VAE 離散視覚/音声トークナイザー
- • 潜在拡散で使用される自己符号化器
よく組み合わせる要素
潜在拡散モデル自己回帰視覚・音声モデル拡散Transformer(DiT)