Architectures de modèles
Autoencodeurs, VAE et tokeniseurs appris
Apprendre un encodeur qui compresse les données et un décodeur qui les reconstruit ; les variantes variationnelles et quantifiées façonnent l'espace latent pour l'échantillonnage ou la génération en aval.
Modèle mental
Un codec appris. Il décide quelles informations survivent avant qu'un autre modèle ne génère dans l'espace compressé.
Flux de données
- Image, audio ou autre signal
- Encodeur
- Codes latents continus ou discrets
- Générateur latent optionnel
- Reconstruction du décodeur
Entraînement
Un objectif de reconstruction préserve le contenu perceptuel. Les VAE ajoutent un régulariseur de distribution ; les modèles vectoriellement quantifiés mappent les représentations sur un codebook discret et ajoutent des objectifs de codebook/engagement.
Exécution de l’inférence
Encoder pour la compression ou l'édition ; échantillonner ou générer une séquence latente/de codes ; décoder vers la modalité d'origine. La qualité de reconstruction limite le meilleur résultat possible en aval.
Atouts
- Réduit la dimensionnalité des médias coûteux
- Crée des latents continus réutilisables ou des jetons discrets
- Sépare l’apprentissage de la représentation du modèle génératif en aval
Compromis
- La compression élimine les détails
- La géométrie latente peut ne pas correspondre à la sémantique en aval
- Les codebooks quantifiés peuvent être sous-utilisés ou introduire des artefacts
À utiliser lorsque
- Les données brutes sont trop coûteuses pour être modélisées directement
- Un modèle génératif a besoin d'un espace continu ou discret compact
- Les échecs de reconstruction sont mesurés par catégorie de contenu
À éviter ou remettre en question lorsque
- La reconstruction sans perte est obligatoire
- Le domaine du codec diffère matériellement des données de production
- Les artefacts du décodeur seraient confondus avec des défaillances du générateur
Familles publiées à titre d’exemple
- • Autoencodeur variationnel (VAE)
- • Tokeniseurs visuels/audio discrets VQ-VAE
- • Autoencodeurs utilisés par diffusion latente