Architectures de modèles
Génération vidéo
Générer conjointement la structure spatiale et temporelle à partir de représentations vidéo fondées sur des trames, des patchs ou des variables latentes, avec des calculs entre trames.
Modèle mental
Génération d'image plus une dimension temporelle, et donc un problème accru de cohérence, de mémoire, de mouvement et d'évaluation.
Flux de données
- Conditionnement texte, image ou vidéo
- Représentation spatiotemporelle
- Diffusion temporelle ou générateur de jetons
- Décodeur/suréchantillonnage vidéo
- Trames + vérification de l'alignement audio
Entraînement
Les objectifs comprennent le débruitage spatiotemporel dans l'espace pixel ou latent et la prédiction du prochain jeton sur les codes visuels. Le conditionnement peut inclure du texte, des images clés, du mouvement, des masques ou des commandes de caméra.
Exécution de l’inférence
Le système échantillonne un clip dans son ensemble ou par fenêtres, souvent avec un raffinement en cascade. Une durée plus longue, une résolution plus élevée et une meilleure cohérence temporelle augmentent toutes la charge de calcul et la pression mémoire.
Atouts
- Synthèse du mouvement conditionnée par le texte ou l'image
- Extension, interpolation et édition vidéo
- Les représentations latentes peuvent amortir le coût des pixels bruts
Compromis
- L'identité et la persistance des objets peuvent dériver avec le temps
- La génération et l'examen humain sont coûteux
- La physique, le timing, le texte lisible et l'audio synchronisé nécessitent des tests dédiés
À utiliser lorsque
- Courts clips créatifs ou transformations contrôlées
- Les modes de défaillance temporelle sont inclus dans la grille d'acceptation
- La génération asynchrone est acceptable
À éviter ou remettre en question lorsque
- Un rendu déterministe en temps réel est requis
- La continuité ou la correction physique ne peuvent pas être examinées
- Le flux de travail ne peut pas prendre en charge les contrôles de traçabilité et de consentement
Familles publiées à titre d’exemple
- • Famille de modèles de diffusion vidéo
- • Générateurs vidéo latents et basés sur des jetons