模型架构
视频生成
利用帧、图像块或潜在视频表示,通过跨帧计算同时生成空间与时间结构。
思维模型
图像生成加上一条时间轴,因此在一致性、记忆、运动和评估方面存在更大的问题。
数据流
- 文本、图像或视频条件
- 时空表示
- 时序扩散或标记生成器
- 视频解码器/上采样器
- 帧 + 音频对齐检查
训练方式
目标包括像素空间或潜在空间的时序去噪,以及视觉代码上的下一个标记预测。条件化可以包括文本、关键帧、运动、遮罩或相机控制。
推理运行方式
系统通常以联合或窗口方式进行片段采样,经常使用级联精炼。更长的持续时间、更高的分辨率和更强的时序一致性都会增加计算量和内存压力。
优势
- 基于文本或图像的运动合成
- 视频扩展、插值和编辑
- 潜在表示可以摊销原始像素的成本
权衡
- 身份和物体持久性可能会随时间漂移
- 生成和人工审查都比较昂贵
- 物理、时间、可读文本和同步音频需要专门的测试
适用场景
- 短小的创意片段或受控变换
- 时序失效模式包含在验收标准中
- 异步生成是可以接受的
应避免或质疑的场景
- 需要实时确定性渲染器
- 无法审查连续性或物理正确性
- 工作流程不支持来源和同意控制
已发表的示例系列
- • 视频扩散模型研究系列
- • 潜在视频扩散和基于标记的视频生成器
常见组合
潜在扩散模型扩散 Transformer(DiT)自回归视觉与音频模型多模态融合模型