模型架构
视觉编码器
将像素转换为特征图、图像块词元或池化向量,供下游分类器、检索器、解码器或多模态模型使用。
思维模型
一个视觉阅读器。它创建表示;生成需要解码器或生成模型。
数据流
- 图像或帧
- 补丁、卷积或混合式前置结构
- 视觉骨干网
- 空间词元 / 特征金字塔 / 池化向量
- 任务头或模态连接器
训练方式
有监督标签、掩码图像建模、自蒸馏、重建和图像-文本对比目标会产生不同的视觉不变性和空间细节级别。
推理运行方式
编码器每次运行一次,针对图像或帧批次。池化输出有利于检索和分类;密集词元图保留更多定位细节以进行检测或多模态推理。
优势
- 可重用的视觉特征
- 高效的分类、检索和感知
- 可以通过投影器或跨注意力将图像连接到语言模型
权衡
- 分辨率和补丁大小决定了损失的细节和词元成本
- 训练目标会创建不同的盲点
- 池化向量不足以完成许多空间任务
适用场景
- 系统必须理解或检索视觉内容
- 您可以根据任务选择池化与空间特征
- 评估小型文本、图表和领域图像
应避免或质疑的场景
- 错误地期望编码器单独生成视觉内容
- 输入分辨率删除所需的细节
- 通用图像基准取代了实际域
已发表的示例系列
- • 视觉 Transformer (ViT)
- • 卷积式分层视觉骨干网
- • CLIP 中的图像塔
常见组合
对比编码器与双编码器多模态融合模型图像和视频生成器