模型架构
潜在扩散模型
在自编码器的低维潜空间中运行扩散过程,然后将生成的表示解码回像素或其他信号。
思维模型
噪声去除一个紧凑的学习草图,而不是每个原始像素。
数据流
- 训练媒体
- 冻结或联合训练的自编码器潜变量
- 条件潜变量降噪器
- 采样干净潜变量
- 解码器 → 媒体
训练方式
首先,自编码器学习感知压缩。然后,扩散模型在这些潜变量上学习降噪目标,通常通过交叉注意力进行条件控制。
推理运行方式
在较小的潜变量张量上进行多步采样,并一次解码。图像到图像和修复可以从编码的、选择性地加噪的源内容开始。
优势
- 比原始高分辨率像素的降噪成本更低
- 模块化的文本条件控制和编辑
- 可重复使用的自编码器和生成器组件
权衡
- 自编码器会造成重构上限
- 精细文本或高频细节可能会在压缩过程中丢失
- 两阶段故障难以归因
适用场景
- 高分辨率媒体生成必须适应实际的计算能力
- 需要编辑和条件控制
- 目标域上验证了编解码器的重建质量
应避免或质疑的场景
- 自编码器丢弃任务关键细节
- 端到端简单性比生成成本更重要
- 潜变量空间捷径可能会隐藏与安全相关的潜在内容
已发表的示例系列
- • 潜在扩散模型
- • Stable Diffusion 研究 lineage
常见组合
自编码器、VAE 与学习型词元器U-Net 降噪器扩散 Transformer(DiT)文本编码器