模型架构
模型选择矩阵
从用户任务和失败模式出发。以下是应优先测试的基准架构,并非放之四海而皆准的最佳方案。
| 产品需求 | 首先测试此基准方案 | 适用原因 | 重点关注 |
|---|---|---|---|
| 开放式助手或编程副驾 | 仅解码器语言模型 + 根据需要进行检索/工具支持 | 灵活的生成和上下文任务适应 | 事实依据、提示注入、工具权限与序列延迟 |
| 分类、提取或大规模重排序 | 仅编码器模型或紧凑型编码器-解码器 | 一次性边界预测可能更便宜且更容易校准 | 领域偏移,输入长度,标签校准 |
| 翻译、转录或忠实于原著的转换 | 编码器-解码器模型 | 专用的源表示会为每个生成的词元提供条件 | 遗漏、名称/数字、源长度、解码延迟 |
| 对大型语料库进行语义搜索 | 双编码器 + 向量索引 + 可选重排序器 | 候选者可以一次嵌入并高效搜索 | 召回率,负样本,过滤器,分数校准 |
| 基于最新或私有知识的回答 | 混合检索增强生成 (RAG) + 重新排序器 + 基于事实的生成器 | 知识保持外部、可审查和可更新 | 数据摄入、访问控制、缺失证据、恶意上下文 |
| 图像生成或编辑任务 | 基于潜扩散的U-Net或DiT去噪器 | 压缩式迭代生成支持强大的条件设置和编辑 | 编码器细节损失、采样延迟、版权与来源 |
| 视频创建 | 时空潜在扩散模型或媒体标记生成器 | 同时建模视觉细节与时间依赖关系 | 身份漂移、运动、时长、计算资源、音频同步 |
| 语音识别 | 专为自动语音识别设计的音频编码器-解码器 | 将声学理解与文本生成分离 | 语言、口音、重叠、噪声、流式延迟 |
| 在严格的资源约束下处理长流序列 | SSM/循环或注意力–SSM混合结构 | 携带紧凑的循环状态而非完整的注意力缓存 | 精确的长程记忆能力、核支持、实际吞吐量 |
| 多模态文档或图表助手 | 视觉编码器 + 语言解码器 + 文档检索 | 保留视觉证据,并将回答锚定到源页面 | 小文本、空间引用、媒体词元成本、引用 |
| 在业务系统中执行可靠的操作 | 确定性策略/控制器内部的工具使用型语言模型 | 语言处理意图,而代码强制执行权限和副作用 | 幂等性、审批流程、重试机制、模式验证、审计追踪 |
从侧边栏打开任一系列,即可查看完整的训练、推理和选择指南。