Architectures de modèles
Modèles visuels et audio autorégressifs
Convertir des images, des vidéos ou de l'audio en codes discrets et prédire ces codes selon un ordre, souvent avec un Transformer causal.
Modèle mental
Faire ressembler les médias à un langage : les tokeniser, choisir un ordre, prédire le code suivant, puis décoder.
Flux de données
- Tokeniseur / codec multimédia
- Codes discrets ordonnés
- Modèle de jeton causal
- Séquence de codes générés
- Décodeur multimédia
Entraînement
Un codec appris est entraîné pour la reconstruction ; le préalable minimise l'entropie croisée du code suivant, éventuellement conditionné par du texte, des trames antérieures, des jetons sémantiques ou des codes à grande échelle.
Exécution de l’inférence
Les codes sont générés séquentiellement ou selon des ordonnancements hiérarchiques ou par blocs, puis décodés. L’ordre détermine la latence et les dépendances faciles à modéliser.
Atouts
- Modélisation basée sur les jetons unifiée entre modalités
- Compatible avec l'infrastructure de modèle de langage causal
- Vraisemblance discrète exacte pour la tokenisation choisie
Compromis
- Les longues séquences de codes créent une latence sérielle
- Les artefacts du tokenizer limitent la qualité de la sortie
- Un ordre unidimensionnel peut être maladroit pour la structure spatiale ou à plusieurs échelles
À utiliser lorsque
- Un codec discret robuste existe
- La modélisation de jetons intermodaux ou la continuation sont importants
- Une génération hiérarchique peut atteindre les objectifs de latence
À éviter ou remettre en question lorsque
- Le décodage sériel prolongé ne respecte pas le budget
- Le codec perd des détails perceptuels critiques
- Une représentation par diffusion continue est sensiblement plus simple
Familles publiées à titre d’exemple
- • Modélisation de pixels/jetons à la manière d'ImageGPT
- • Générateurs d'images avec jetons VQ
- • Hiérarchie code-jeton à la manière d'AudioLM
Souvent combinée avec
Transformers à décodeur uniquementVQ-VAE / codec neuronalFusion de jetons multimodaux