模型架构
自回归视觉与音频模型
将图像、视频或音频转换为离散代码并按顺序预测,通常使用因果 Transformer。
思维模型
使媒体看起来像一种语言:对其进行分词,选择一个顺序,预测下一个代码,然后解码。
数据流
- 媒体分词器/编解码器
- 有序离散代码
- 因果词元模型
- 生成的代码序列
- 媒体解码器
训练方式
训练学习的编解码器以进行重建;先验最小化下一个代码的交叉熵,可以选择有条件地基于文本、先前帧、语义词元或粗尺度代码。
推理运行方式
按顺序或分层/块状方式生成代码,然后解码。排序决定延迟以及哪些依赖关系易于建模。
优势
- 跨模态统一基于词元的模型
- 与因果语言模型基础设施兼容
- 所选标记化的精确离散似然
权衡
- 较长的代码序列会产生串行延迟
- 分词器伪影限制输出质量
- 一维排序可能不适用于空间或多尺度结构
适用场景
- 存在强大的离散编解码器
- 跨模态词元建模或延续很重要
- 分层生成可以满足延迟目标
应避免或质疑的场景
- 长时间的串行解码超出预算
- 编解码器丢失了关键感知细节
- 连续扩散表示形式要简单得多
已发表的示例系列
- • ImageGPT 风格的像素/词元建模
- • VQ-词元图像生成器
- • AudioLM 风格的编解码器-词元层次结构
常见组合
仅解码器 Transformer 模型VQ-VAE / 神经编解码器多模态词元融合