Architectures de modèles
Modèles audio, vocaux et musicaux
Une famille de pipelines spécifiques aux tâches : la reconnaissance automatique de la parole (ASR), la synthèse vocale (TTS), la compréhension audio, la conversion vocale, la génération sonore et la génération musicale ne constituent pas une seule architecture.
Modèle mental
Choisissez d’abord la tâche. L’ASR transforme l’audio en texte ; la TTS et la génération musicale transforment des conditions en représentations acoustiques ou de codec ; la compréhension audio produit des étiquettes ou des embeddings.
Flux de données
- Forme d'onde ou spectrogramme
- Représentation acoustique / codec
- Encodeur, seq2seq, diffusion ou générateur de jetons
- Texte, étiquettes, jetons codec ou forme d'onde
- Décodage spécifique à la tâche
Entraînement
Les objectifs varient : la transcription utilise une vraisemblance de séquence, l'apprentissage des représentations peut masquer l'audio, les générateurs de codecs prédisent des jetons audio discrets et les systèmes de diffusion apprennent le débruitage dans l'espace forme d'onde, spectrogramme ou latent.
Exécution de l’inférence
L’ASR encode généralement l’audio puis décode le texte ; la génération peut prédire des jetons de codec de façon autorégressive ou procéder par débruitage itératif. Les contraintes de streaming peuvent imposer des encodeurs par segments et une anticipation limitée.
Atouts
- Transcription et traduction vocale
- Synthèse naturelle de la parole, du son et de la musique
- Les embeddings audio prennent en charge la recherche, la modération et la classification
Compromis
- Accent, bruit, chevauchement, code-switching et décalage du vocabulaire affectent la qualité
- La génération à long terme nécessite une structure temporelle et une cohérence
- L'identité vocale, le consentement, l'empreinte numérique (watermarking) et les droits d'auteur nécessitent une gouvernance explicite
À utiliser lorsque
- La modalité elle-même contient des informations nécessaires
- Vous disposez d'évaluations spécifiques à la tâche, à la langue et à l'environnement
- Les exigences de latence et de streaming sont conçues à l'avance
À éviter ou remettre en question lorsque
- Une transcription contient déjà toutes les informations pertinentes
- Le clonage d'identité manque de consentement éclairé
- Un seul benchmark est utilisé comme preuve dans différentes langues et conditions acoustiques
Familles publiées à titre d’exemple
- • ASR encodeur-décodeur de type Whisper
- • Génération hiérarchique de jetons codec AudioLM
- • Systèmes audio ou diffusion latente