模型架构
状态空间与循环模型
在接收到每个词元时更新紧凑的状态,而不是保留所有位置对之间的显式注意力关系。
思维模型
将序列通过学习的状态转移函数传递;该状态是过去压缩后的记忆。
数据流
- 当前 词元 + 先验状态
- 学习的状态更新
- 选择性门控或循环混合器
- 输出隐藏状态
- 向前携带状态
训练方式
序列建模损失与循环或结构化状态空间层配对。并行扫描或其他相关公式可以使训练比朴素的步进式 RNN 更具并行性。
推理运行方式
解码过程维护每层中的有界循环状态。混合架构可能交替使用状态空间、卷积和注意力层,以恢复每个机制处理良好的能力。
优势
- 核心循环运算具有线性时间序列处理能力
- 推理时具有紧凑的流式状态
- 天然适用于长序列或持续到达的序列
权衡
- 压缩的状态可能会丢失精确的远程细节
- 工具和优化的内核可能不如标准注意力成熟
- 必须对架构级别的复杂性声明进行端到端的验证
适用场景
- 流式或长序列效率是首要要求
- 目标运行时具有优化的内核
- 在实际工作负载上对召回、质量和吞吐量进行基准测试
应避免或质疑的场景
- 假设无需测试即可从长上下文精确地任意检索
- 服务堆栈无法利用此架构
- 现有的 Transformer 部署已经满足预算
已发表的示例系列
- • Mamba 选择性状态空间模型
- • RWKV 风格的循环语言模型
- • 混合注意力–SSM 堆栈
常见组合
仅解码器 Transformer 模型混合专家模型(MoE)混合注意力层