模型架构
仅解码器 Transformer 模型
使用因果掩码,使每个位置只能看到之前的词元,从而匹配大多数通用聊天模型使用的从左到右的生成过程。
思维模型
将前缀压缩成注意力状态,预测一个延续词元,附加它并重复。
数据流
- 前缀词元
- 因果自注意力机制
- 每个位置的隐藏状态
- 词汇表logits
- 下一个词元 → 重复
训练方式
下一词元交叉熵在每个位置提供学习信号。 训练后可以添加指令示例、偏好设置、可验证奖励或工具轨迹。
推理运行方式
预填充处理提示语;解码逐个序列地输出词元,同时KV缓存存储过去的注意力键和值。上下文大小、缓存内存和输出长度驱动服务行为。
优势
- 一个可扩展的接口用于许多生成任务
- 具有强大的上下文适应性
- 可以交织散文、代码、结构化数据和工具调用词元
权衡
- 序列解码延迟
- 标准全注意力机制下的二次预填充
- 提示词敏感性和概率性输出需要验证
适用场景
- 开放式生成或交互式聊天是核心
- 许多任务可以共享一个模型端点
- 你可以在产品循环中约束并评估输出
应避免或质疑的场景
- 小型编码器或确定性组件满足要求
- 假设无需验证即可获得精确的输出
- 应该搜索长源语料库而不是将其全部放入上下文中
已发表的示例系列
- • GPT风格因果语言模型
- • LLaMA研究系列
常见组合
文本与聊天语言模型混合专家模型(MoE)多模态融合模型RAG工具使用与推理系统