模型架构
架构术语表
模型论文和产品文档中常用术语的简明定义。
- 注意力机制
- 一种学习到的加权查找机制,允许一个位置结合来自其他位置的信息。
- 自回归
- 将输出分解为有序序列,并根据之前的元素预测每个元素。
- 因果掩码
- 在从左到右的语言建模中,阻止一个词元关注未来词元。
- 引导
- 用于指导生成的信息(例如文本、图像、标签或控制信号)。
- 交叉注意力
- 允许一个序列查询另一个序列或模态的隐藏状态。
- 去噪
- 学习或应用一个步骤来估计干净的数据,或者从噪声样本中进行逆向更新。
- 嵌入 (Embedding)
- 一种用于表示相似性或进行后续预测的、学习得到的数值向量。
- 专家/路由器
- 在混合专家(MoE)层中,专家是子网络,路由器负责为每个词元选择处理它的专家。
- 流匹配
- 学习一种随时间变化的向量场,用于在概率分布之间传输样本。
- 事实依据(grounding)
- 将模型响应与提供的可检查的证据或外部事实来源关联起来。
- KV缓存
- 存储先前词元的注意力键和值,并在自回归解码时重复使用。
- 潜在表示
- 一种学习到的内部表征,通常比原始数据维度更低。
- 模态投影器
- 一种连接器,用于将一个编码器的特征映射到另一个模型期望的表示形式。
- 重排序器
- 一种第二阶段模型,用于对小型候选集进行评分,并利用更丰富的查询-候选交互。
- 循环状态
- 一种从一个序列步骤传递到下一个序列步骤的有限隐藏表示。
- 词元/代码
- 序列模型处理的离散单元;它可以表示文本、图像块或压缩音频。