模型架构
图像生成与编辑
通过文本或图像引导、潜在生成器和图像解码器等模块综合或转换像素。
思维模型
一个流程,而非单一网络:提示编码器 → 生成过程 → 潜在/像素解码器,通常带有独立的控制和安全组件。
数据流
- 文本、图像、遮罩或布局条件
- 条件编码器
- 潜在扩散、DiT 或自回归生成器
- 图像解码器
- 候选图像 + 检查
训练方式
现代系统通常在像素或压缩的潜在空间中学习去噪或流目标。 对文本的对齐依赖于配对数据和引导;自动编码器可能单独训练。
推理运行方式
一个采样器从噪声或带噪声的源图像开始,迭代地在条件下细化它,然后解码潜在变量。种子可提高重现性,但不能使所有运行时路径都变为确定性的。
优势
- 高质量开放式视觉合成
- 天然支持变化、修复和引导编辑
- 潜在流水线使高分辨率生成更实用
权衡
- 多个采样步骤会增加延迟
- 文本、排版、身份和精确空间约束需要显式评估
- 训练数据权利、来源和滥用控制是产品问题
适用场景
- 创意构思、资产草稿或受控图像转换
- 输出可以被审查或约束
- 视觉质量和提示遵从性被单独评估
应避免或质疑的场景
- 需要像素级精确的布局
- 输出是真实事件或身份的证据
- 权利和来源要求尚未解决
已发表的示例系列
- • 潜在扩散 / Stable Diffusion 研究谱系
- • 扩散Transformer (DiT) 研究架构
常见组合
潜在扩散模型扩散 Transformer(DiT)视觉编码器多模态融合模型