Architectures de modèles
Transformers de diffusion (DiT)
Utilisez un Transformer appliqué à des patchs d'image ou de vidéo bruités comme réseau de débruitage au sein d'un processus génératif par diffusion ou par flux.
Modèle mental
DiT modifie l’architecture principale du débruiteur ; il n’élimine pas le processus de diffusion, le codec latent, la conditionnalité ou l'échantillonneur.
Flux de données
- Latent bruité
- Patchification + conditionnement positionnel / temporel
- Blocs Transformer
- Mise à jour latente prédite
- Étape d'échantillonnage → répétition
Entraînement
Le modèle apprend la même classe d’objectif de débruitage, de vélocité ou de flux que les autres systèmes de diffusion, tandis que les blocs Transformer mélangent l'information entre les patchs latents.
Exécution de l’inférence
Un échantillonneur invoque à plusieurs reprises le Transformer à différents moments de bruit ou de flux, puis un décodeur mappe le latent final vers les médias.
Atouts
- Évolutivité et écosystème d'implémentation des Transformers
- Interactions globales entre les patchs latents
- Chemin naturel vers un traitement multimodal de jetons partagé
Compromis
- Le coût de l'attention augmente avec le nombre de jetons latents
- Nécessite toujours des appels répétés au débruiteur
- “DiT” seul ne spécifie pas de codec, d’objectif, de conditionnalité ou d'échantillonneur
À utiliser lorsque
- Une infrastructure évolutive pour les Transformers est disponible
- Le nombre de patchs latents et la latence d'échantillonnage respectent le budget
- Vous avez besoin d’une architecture principale flexible pour la génération d'images ou de vidéos
À éviter ou remettre en question lorsque
- Un petit U-Net atteint déjà l'objectif
- L'étiquette est utilisée comme une spécification architecturale complète
- Les comptes de jetons haute résolution submergent l'environnement d'exécution cible
Familles publiées à titre d’exemple
- • Famille de recherche DiT
- • Débruiteurs Transformer dans des pipelines latents pour l’image et la vidéo
Souvent combinée avec
Diffusion latenteAutoencodeurs, VAE et tokeniseurs apprisConditionnalité multimodaleMélange d’experts (MoE)