模型架构
扩散与基于得分的生成
学习逆转一个逐渐添加噪声的过程,通过反复将噪声转换为样本来生成数据。
思维模型
从静态开始,根据时间步长和可选条件重复移除预测的噪声。
数据流
- 干净训练样本 + 采样噪声等级
- 带噪声的样本
- U-Net 或 Transformer 降噪器
- 噪声 / 速度 / 得分估计
- 迭代逆向采样器
训练方式
一个网络预测噪声、干净数据、速度或在随机采样的噪声等级下的得分。相关的流匹配公式学习分布之间的向量场。
推理运行方式
采样跨多个步骤集成一个学习到的反向过程。采样器的选择、步数、引导和种子之间存在速度、多样性和保真度的权衡关系。
优势
- 相对于对抗性目标,训练更加稳定
- 灵活的条件设置和编辑能力
- 对图像、音频、视频和科学数据具有良好的覆盖范围
权衡
- 迭代采样比一次性生成器更慢
- 引导可能会降低多样性或引入伪影
- 数据表示和采样器会显著影响结果
适用场景
- 高维条件生成至关重要
- 多个推理步骤适合延迟预算
- 可以联合评估控制和样本质量
应避免或质疑的场景
- 必须进行一次性生成
- 模型必须运行在受限设备上
- “扩散”被视为一种固定的实现
已发表的示例系列
- • DDPM
- • 基于得分的模型
- • 像素空间扩散系统
常见组合
U-Net扩散 Transformer(DiT)潜在扩散模型