模型架构
编码器-解码器 Transformer 模型
双向编码输入,然后因果生成输出,同时跨注意力关注编码的源。
思维模型
一个阅读者和一个写入者通过交叉注意力连接。
数据流
- 源序列
- 双向编码器
- 源记忆
- 因果解码器 + 跨注意力
- 目标序列
训练方式
通常采用教师强制的目标词元似然训练。文本到文本去噪或Span损坏让许多任务共享相同的输入/输出接口。
推理运行方式
源被编码一次;解码器在关注稳定的源状态的同时自回归生成目标。波束搜索对某些受限的任务有帮助,但并非普遍最佳方案。
优势
- 源理解和目标生成之间分离清晰
- 非常适合翻译、摘要、转录和转换任务
- 整个解码过程中重用源记忆
权衡
- 两个堆栈会增加参数量和部署复杂性
- 目标解码仍然是串行的
- 对于异构聊天任务,可能不如单解码器-仅接口方便
适用场景
- 输出受特定输入的严格条件约束
- 源和目标具有不同的结构或模态
- 忠实转换比开放式延续更重要
应避免或质疑的场景
- 单个通用聊天界面是首要需求
- 不存在明确的源序列
- 非生成式编码器头就足够了
已发表的示例系列
- • 原始Transformer模型
- • T5
- • Whisper语音识别架构
常见组合
文本转换音频 / 语音多模态融合模型