模型架构
混合专家模型(MoE)
用多个专家网络和一个学习到的路由器替换选定的密集子层,路由器只为每个词元激活其中一小部分。
思维模型
具有稀疏逐 词元 激活的大参数容量;稀疏计算并不意味着小的内存或简单的服务。
数据流
- 词元隐藏状态
- 路由器评估专家
- Top-k 专家派发
- 专家变换
- 加权合并 + 残差路径
训练方式
主任务损失训练专家和路由器。负载均衡或路由正则化防止坍缩到少数专家;分布式实现必须协调 词元 派发。
推理运行方式
每个词元访问选定的专家。算术运算可以保持稀疏,而模型权重、设备间通信、路由不平衡和批处理仍然会影响延迟和成本。
优势
- 无需为每个词元激活所有参数即可获得更多的参数容量
- 通过学习到的路由,专家可以实现专业化
- Transformer 前馈块内部自然扩展
权衡
- 大型权重内存和分布式通信
- 路由不平衡和容量溢出使训练复杂化
- 报告的总参数无法揭示活动计算或服务效率
适用场景
- 大规模的训练和服务基础设施能够利用稀疏路由
- 容量受限,但逐 词元 算术受限
- 您可以基准测试实际的硬件拓扑
应避免或质疑的场景
- 需要单设备或内存受限的部署
- “稀疏”被假定为保证更低的延迟
- 操作简单比额外容量更有价值
已发表的示例系列
- • Switch Transformer
- • 语言或多模态模型内部的稀疏专家层
常见组合
仅解码器 Transformer 模型编码器-解码器 Transformer 模型扩散 Transformer(DiT)