模型架构
自编码器、VAE 与学习型词元器
学习一个压缩数据的编码器和一个重构数据的解码器;变分和量化的变体塑造潜在空间以进行采样或下游生成。
思维模型
一种学习到的编解码器。它决定哪些信息能够幸存,以便另一个模型在压缩空间中生成内容。
数据流
- 图像、音频或其他信号
- 编码器
- 连续潜变量或离散代码
- 可选潜变量生成器
- 解码器重构
训练方式
一个重构目标保留感知内容。VAE 添加分布正则化;向量量化模型将表示映射到离散码本,并添加码本/承诺目标。
推理运行方式
用于压缩或编辑进行编码;对潜变量/代码序列进行采样或生成;解码为原始模态。重构质量限制了最佳的下游输出。
优势
- 降低昂贵媒体的维度
- 创建可重复使用的连续潜变量或离散 词元s
- 将表征学习与生成先验分离
权衡
- 压缩会丢弃细节
- 潜变量几何形状可能不匹配下游语义
- 量化的码本可能被低利用或引入伪影
适用场景
- 原始媒体过于昂贵,无法直接建模
- 需要一种紧凑的连续或离散空间用于生成模型
- 重构失败由内容切片衡量
应避免或质疑的场景
- 必须进行无损重构
- 编解码器域与生产数据有实质性差异
- 解码器伪影会被误认为是生成器故障
已发表的示例系列
- • 变分自编码器 (VAE)
- • VQ-VAE 离散视觉/音频 词元s 分词器
- • 潜扩散模型使用的自编码器
常见组合
潜在扩散模型自回归视觉与音频模型扩散 Transformer(DiT)