模型架构
音频、语音和音乐模型
一系列任务特定流水线:语音识别、语音合成、音频理解、声音转换、声音生成以及音乐生成,它们并非单一架构。
思维模型
首先选择任务。ASR 将音频映射到文本;TTS 和音乐生成将条件映射到声学或编码器表示;理解将音频映射到标签或嵌入向量。
数据流
- 波形或频谱图
- 声学/编码器表示
- 编码器、seq2seq、扩散模型或分词生成器
- 文本、标签、编码器词元或波形
- 任务特定解码
训练方式
目标函数各异:转录使用序列似然,表征学习可能遮蔽音频,编码器生成器预测离散的音频词元,扩散系统在波形、频谱图或潜在空间中学习去噪。
推理运行方式
ASR 通常对音频进行编码然后解码文本;生成过程可能自回归地预测编码器词元或迭代地对噪声进行去噪。流式传输约束可能需要分块编码器和有限的提前查看范围。
优势
- 语音转录和翻译
- 自然语音、声音和音乐合成
- 音频嵌入支持搜索、审核和分类
权衡
- 口音、噪声、重叠、语码转换以及领域词汇变化会影响质量
- 长文本生成需要时序结构和一致性
- 声音身份、许可、水印以及版权需要明确的治理
适用场景
- 模态本身携带了所需的信息
- 您拥有任务、语言和环境特定的评估
- 延迟和流式传输要求是预先设计好的
应避免或质疑的场景
- 已经有的文本转录包含了所有相关信息
- 身份克隆缺乏知情同意
- 一个基准被用于跨语言和声学条件进行验证
已发表的示例系列
- • Whisper 风格的编码器-解码器 ASR
- • AudioLM 风格的分层编码器-词元生成
- • 波形或潜在扩散音频系统
常见组合
编码器-解码器 Transformer 模型自回归视觉与音频模型扩散模型对比编码器与双编码器