模型架构
对比编码器与双编码器
独立地对两个输入进行编码(例如,查询和文档或图像和标题),并训练匹配对使其落在彼此附近。
思维模型
两个阅读器在共享坐标系中相遇;由于候选者只有在其向量被比较时才会交互,因此它们运行速度很快。
数据流
- 配对的输入 A 和 B
- 分离或共享编码器
- 投影归一化向量
- 相似度矩阵
- 对比匹配损失
训练方式
批次对比目标奖励成对示例,并将其他示例视为负例。 负质量、重复语义和温度会显著影响学习的空间。
推理运行方式
独立地对各侧进行编码,并使用点积或余弦相似度比较向量。 预先计算大的候选者侧;根据需要可选择使用跨编码器重新排序前几名结果。
优势
- 将检索扩展到大型语料库
- 无需联合解码器即可对齐模态
- 在某些情况下,通过标签文本实现零样本分类
权衡
- 独立编码会遗漏细粒度的跨输入交互
- 虚假负例会扭曲训练
- 全局相似度可能会忽略空间、时间或组合细节
适用场景
- 快速检索或匹配是第一阶段
- 可以离线索引其中一侧
- 需要任务特定的重新排序以实现召回
应避免或质疑的场景
- 每个候选者都需要深层次的词元到词元比较
- 任务取决于精确的空间关系
- 原始相似度分数被假定为概率
已发表的示例系列
- • CLIP 图像-文本双编码器
- • 密集段落检索
- • 双编码器语义搜索
常见组合
嵌入模型视觉编码器RAG跨编码器重新排序器