模型架构
嵌入模型
将文本、图像、音频、用户或项目映射为向量,并通过训练使其几何关系保留有用的相似性概念。
思维模型
一个学习到的坐标系。接近意味着“在训练目标下相似”,而不是普遍等价或事实上相关。
数据流
- 输入项
- 编码器
- 池化或投影
- 固定长度的向量
- 相似度搜索、聚类或分类器
训练方式
对比学习、指标学习、分类或配对数据目标将有用的匹配物拉近,并将负样本推开。负采样策略和领域数据定义了相似性意味着什么。
推理运行方式
每个项目都可以在一次前向传播中进行编码。存储的向量能够实现快速近似最近邻搜索;一个交叉编码器可以重新对排名靠前的候选集进行精细交互。
优势
- 大规模集合的高效语义检索
- 用于聚类、路由、推荐和去重的可重用特征
- 候选向量可以在正交时间计算并建立索引
权衡
- 单个向量压缩了词级别的细节
- 相似性在领域、语言或时间漂移下会下降
- 分数是模型和索引特定的,而不是校准后的概率
适用场景
- 你需要语义候选检索
- 语料库太大,无法进行成对评分
- 你可以在生产形状的查询上评估召回率
应避免或质疑的场景
- 精确词汇匹配是唯一的要求
- 你需要生成的响应而不是表示
- 将部署相似性阈值而不进行校准
已发表的示例系列
- • BERT-派生的句子编码器
- • CLIP 中使用的单独文本和图像塔
常见组合
仅编码器 Transformer 模型对比编码器与双编码器检索增强与混合系统