モデルアーキテクチャ
オーディオ・音声・音楽モデル
タスク固有のパイプライン群:音声認識、音声合成、音声理解、声変換、音響生成、および音楽生成は単一のアーキテクチャではありません。
理解のためのモデル
まずタスクを選択してください。ASR はオーディオをテキストにマッピングし、TTS と音楽生成は条件を音響またはコーデック表現にマッピングし、理解はオーディオをラベルまたは埋め込みにマッピングします。
データフロー
- 波形またはスペクトログラム
- 音響 / コーデック表現
- エンコーダ、seq2seq、拡散、またはトークンジェネレータ
- テキスト、ラベル、コーデック トークン、または波形
- タスク固有のデコード
学習方法
目的は様々です:書き起こしでは系列尤度が使用され、表現学習ではオーディオをマスクすることがあり、コーデックジェネレータは離散的なオーディオトークンを予測し、拡散システムは波形、スペクトログラム、または潜在空間でのノイズ除去を学習します。
推論の実行方法
ASR は通常、オーディオをエンコードしてからテキストをデコードします。生成では、コーデック トークンを自己回帰的に予測するか、反復的にノイズを除去することがあります。ストリーミング制約により、チャンク化されたエンコーダとバウンデッドなルックアヘッドが必要になる場合があります。
強み
- 音声の書き起こしと翻訳
- 自然な音響、音、および音楽合成
- オーディオ埋め込みは検索、モデレーション、および分類をサポート
トレードオフ
- アクセント、ノイズ、オーバーラップ、コードスイッチング、およびドメイン語彙の変化による品質への影響
- 長文生成には時間構造と一貫性が必要
- 声の同一性、同意、ウォーターマーキング、および著作権には明示的なガバナンスが必要
適する場合
- モダリティ自体が情報を伝えている
- タスク固有、言語固有、および環境固有の評価がある
- レイテンシとストリーミング要件を事前に設計している
避ける・再検討する場合
- トランスクリプトに既にすべての関連情報が含まれている
- 同一性クローニングに十分なインフォームドコンセントがない
- 1 つのベンチマークが異なる言語や音響条件で検証として使用されている
公開された方式の例
- • Whisper スタイルのエンコーダ・デコーダ ASR
- • AudioLM スタイルの階層的なコーデック トークン生成
- • 波形または潜在拡散オーディオ システム
よく組み合わせる要素
Encoder–Decoder型Transformer自己回帰視覚・音声モデル拡散対照学習型/デュアルエンコーダ