模型架构
多模态融合模型
通过投影、交叉注意力、共享词元空间或其组合,连接特定模态的编码器与生成器。
思维模型
“多模态”指代输入和输出,而非一种单一拓扑结构。始终思考模态信息的编码、融合和解码的位置。
数据流
- 文本 / 图像 / 音频 / 视频
- 模态编码器或分词器
- 投影器、交叉注意力机制或共享骨干网
- 联合表示 / 语言解码器
- 文本、媒体或动作输出
训练方式
系统结合对比对齐、字幕生成或下一个词元概率预测、掩码目标以及有时预训练的冻结组件进行训练。
推理运行方式
输入被编码为模态词元或特征,在语言/生成骨干网之前或内部融合,并解码为一种或多种模态。输入理解并不意味着输出生成。
优势
- 将语言置于视觉或听觉输入的基础之上
- 支持文档、图表、图像、视频和音频工作流程
- 可以重用强大的预训练模态组件
权衡
- 模态不平衡和连接器瓶颈
- 媒体词元消耗大量的上下文信息和计算资源
- 评估必须分离感知、对齐、推理和生成
适用场景
- 任务真正依赖于非文本证据
- 已评估模态特定的切片和弃权行为
- 架构暴露了足够的细节进行成本和隐私审查
应避免或质疑的场景
- 一个转录、OCR结果或结构化提取器就足够
- “支持图像”被假定为精确感知
- 敏感媒体处理和保留未明确定义
已发表的示例系列
- • Flamingo 交叉注意力机制架构
- • BLIP-2 学习查询连接器
- • 共享词元的多模态解码器系统
常见组合
视觉 / 音频编码器仅解码器 Transformer 模型对比对齐媒体生成器