模型架构
扩散 Transformer(DiT)
在扩散或基于流的生成过程中,将Transformer作为降噪网络应用于带有噪声的图像或视频块。
思维模型
DiT 改变了降噪器的骨干结构;它并没有消除扩散过程、潜在编码器、条件设置或采样器。
数据流
- 带噪声的潜在空间
- 打块 + 位置/时间条件设置
- Transformer模块
- 预测的潜在空间更新
- 采样步骤 → 重复
训练方式
该模型学习与其它扩散系统相同的降噪、速度或流目标,同时Transformer模块在潜在块之间混合信息。
推理运行方式
一个采样器反复调用Transformer于不同的噪声或流时间点,然后解码器将最终的潜在空间映射到媒体。
优势
- Transformer的扩展和实现生态系统
- 潜在块之间的全局交互
- 自然地导向共享的多模态词元处理
权衡
- 注意力成本随着潜在词元数量增长
- 仍然需要反复调用降噪器
- “DiT” 本身不指定编码器、目标、条件设置或采样器
适用场景
- 具有Transformer扩展基础设施
- 潜在块数和采样延迟符合预算
- 您需要图像或视频生成的一种灵活骨干结构
应避免或质疑的场景
- 小型 U-Net 已经满足了目标
- 标签被用作完整的架构规范
- 高分辨率的词元数量会使目标运行时不堪重负
已发表的示例系列
- • DiT 研究家族
- • 潜入图像和视频管道中的Transformer降噪器
常见组合
潜在扩散模型自编码器、VAE 与学习型词元器多模态条件设置混合专家模型(MoE)