模型架构
模型架构实用指南
生成模型架构
了解文本、嵌入、图像、视频、音频和多模态产品背后的实际结构,再根据目标选择骨干网络、表示方式、生成器和系统封装。
22 个架构系列 · 5 个分组 · 每个系列一个页面
关键区别
能力不等于架构
“聊天”“图像”和“多模态”描述的是交互界面;仅解码器、状态空间、DiT 和 MoE 描述内部计算;RAG 与工具使用描述模型外围的运行时系统。一个生产系统完全可能同时拥有这三类标签。
= 聊天能力
+ 仅解码器骨干网络
+ 检索与重排序
+ 类型化工具控制器
+ 策略与人工升级
编写架构档案
- 1能力: 输入、输出、用户任务与所需证据
- 2表示: 词元、向量、像素、编解码器代码或连续潜变量
- 3骨干网络: 编码器、解码器、序列到序列、注意力、SSM 或混合结构
- 4容量: 稠密或专家路由;总参数与激活参数
- 5生成: 自回归、扩散/流、对抗式或确定性
- 6系统: 检索、工具、验证器、权限、监控与人工参与
浏览全部 22 个系列
每个系列都有独立页面,介绍训练、推理、优势、权衡和选择指南。
产品能力
产品接受和返回的内容。这些是部署形态,而非相互排斥的神经网络架构。
核心骨干网络
信息如何流经可训练的网络。已部署的模型可能结合多种选择。
仅编码器 Transformer 模型
让每个输入词元关注两侧的词元,生成上下文表示,而不是开放式的生成循环。
仅解码器 Transformer 模型
使用因果掩码,使每个位置只能看到之前的词元,从而匹配大多数通用聊天模型使用的从左到右的生成过程。
编码器-解码器 Transformer 模型
双向编码输入,然后因果生成输出,同时跨注意力关注编码的源。
混合专家模型(MoE)
用多个专家网络和一个学习到的路由器替换选定的密集子层,路由器只为每个词元激活其中一小部分。
状态空间与循环模型
在接收到每个词元时更新紧凑的状态,而不是保留所有位置对之间的显式注意力关系。
表征与生成
图像、音频、视频和其他高维输出是如何被表示、学习和采样的。
自编码器、VAE 与学习型词元器
学习一个压缩数据的编码器和一个重构数据的解码器;变分和量化的变体塑造潜在空间以进行采样或下游生成。
生成对抗网络(GAN)
训练一个生成器来欺骗判别器,同时判别器学习区分生成的样本和训练数据。
归一化流
通过一系列具有可跟踪雅可比矩阵的可逆映射,将一个简单的分布转换为复杂的数据分布。
扩散与基于得分的生成
学习逆转一个逐渐添加噪声的过程,通过反复将噪声转换为样本来生成数据。
潜在扩散模型
在自编码器的低维潜空间中运行扩散过程,然后将生成的表示解码回像素或其他信号。
扩散 Transformer(DiT)
在扩散或基于流的生成过程中,将Transformer作为降噪网络应用于带有噪声的图像或视频块。
自回归视觉与音频模型
将图像、视频或音频转换为离散代码并按顺序预测,通常使用因果 Transformer。
跨模态接口
视觉、文本、音频及其他模态如何被编码、对齐、融合或连接到生成器。
人工智能系统架构
围绕模型的运行时结构,用于添加知识、工具、控制与可验证行为。