模型架构
生成对抗网络(GAN)
训练一个生成器来欺骗判别器,同时判别器学习区分生成的样本和训练数据。
思维模型
一个伪造者和一个评论家相互改进;经过训练后,伪造者可以在一次前向传播中生成内容。
数据流
- 随机潜在变量 + 条件
- 生成器
- 合成样本
- 判别器比较真实与合成
- 对抗梯度更新两者
训练方式
最小极大对抗目标将两个网络耦合在一起。实用的变体改变损失函数、正则化、归一化和条件设置以稳定训练并控制输出。
推理运行方式
采样一个潜在变量,一次运行生成器,使生成速度很快。反转或编辑需要额外的机制,因为没有内置的迭代逆过程。
优势
- 快速的一次性采样
- 在具有良好范围的可视域中产生清晰的输出
- 有用的条件和图像到图像变体
权衡
- 训练不稳定和模式坍塌
- 难以评估覆盖率和似然性
- 大型开放域文本条件生成已转向其他模型簇
适用场景
- 低延迟采样对受限领域很重要
- 现有的 GAN 流程已经适应了数据并实现了控制
- 显式评估多样性和覆盖率
应避免或质疑的场景
- 稳定训练和广泛的模式覆盖是主要要求
- 团队缺乏特定领域的评估能力
- 没有对比较新的扩散或自回归基线
已发表的示例系列
- • 原始 GAN 公式
- • StyleGAN 研究家族
- • 条件图像到图像 GAN
常见组合
卷积或 Transformer 生成器用于反转和编辑的编码器