模型架构
文本与聊天语言模型
逐个词元生成文本,通常使用经下一词元预测训练的因果解码器,再通过后续训练使其遵循指令。
思维模型
一个被对话协议包裹的概率延续引擎,而非数据库、搜索引擎或确定性规则引擎。
数据流
- 消息、文档或代码
- 分词器 + 角色/工具标记
- 因果语言模型主干
- 下一个词元分布
- 解码直到停止条件
训练方式
预训练通常通过最大化大型词元序列上的下一个词元交叉熵损失。指令微调、偏好优化、安全训练和工具使用示例随后塑造交互行为;它们不改变对证据和评估的基本需求。
推理运行方式
模型反复预测并采样或选择一个下一个词元。KV缓存重用先前的注意力状态;较长的答案保持串行,解码设置改变可变性而非事实性。
优势
- 开放式写作、转换、解释、代码和对话
- 能够从上下文中的指令和示例中学习任务
- 在约束和验证的情况下可以发出结构化的工具调用或模式
权衡
- 可能会产生流利但不受支持的主张
- 自回归输出增加了每个词元的延迟
- 上下文、提示和采样选择会显著影响行为
适用场景
- 任务需要灵活的语言生成或合成
- 一个评估标准和有代表性的评估集可以定义可接受的行为
- 可以通过检索或工具获取新鲜的事实
应避免或质疑的场景
- 确定性解析器、查询或规则引擎可靠地解决问题
- 需要精确的当前事实,但没有连接到受信任的数据源
- 未经审核的输出可能直接触发高影响的操作
已发表的示例系列
- • GPT风格的因果语言模型
- • 指令微调的后代,例如InstructGPT研究系统
常见组合
仅解码器 Transformer 模型混合专家模型(MoE)检索增强与混合系统工具使用与推理系统