模型架构
仅编码器 Transformer 模型
让每个输入词元关注两侧的词元,生成上下文表示,而不是开放式的生成循环。
思维模型
读取整个输入,对每个位置进行上下文化处理,然后池化或连接任务头。
数据流
- 词元序列
- 双向自注意力模块
- 上下文化的词元状态
- 池化器或任务头
- 类别、跨度、分数或向量
训练方式
掩码词重建是经典的预训练目标,随后是特定于任务的分类、词元标记、跨度预测或指标学习。
推理运行方式
一次前向传播处理可用的输入。它天然适用于理解和表示,但自身不生成任意延续。
优势
- 丰富的双向上下文信息,适用于分类和提取
- 对输入的并行处理
- 通常在处理大量有界任务时效率高
权衡
- 不是开放式的生成器
- 最大输入长度和二次注意机制可能会限制长文档
- 通常需要任务头或池化策略
适用场景
- 分类、命名实体识别、重新排序或嵌入占据主导地位
- 预测之前完整输入可用
- 较小的专用模型可以满足标准
应避免或质疑的场景
- 主要输出是长篇自由文本
- 需要流式生成
- 输入常规超过评估的上下文策略
已发表的示例系列
- • BERT和RoBERTa研究家族
- • 基于编码器的重排器和分类器
常见组合
嵌入模型视觉编码器对比编码器与双编码器检索增强与混合系统