Modellarchitekturen
Videogenerierung
Räumliche und zeitliche Strukturen werden gemeinsam aus Frame-, Patch- oder latenten Videorepräsentationen mit bildübergreifender Berechnung erzeugt.
Denkmodell
Bildgenerierung plus eine Zeitachse, wodurch ein wesentlich größeres Konsistenz-, Gedächtnis-, Bewegungs- und Bewertungsproblem entsteht.
Datenfluss
- Text-, Bild- oder Videoeingabe
- Räumlich-zeitliche Darstellung
- Zeitliche Diffusion oder Token-Generator
- Videodecoder / Hochskalierer
- Frames + Audioausrichtungskontrollen
So wird trainiert
Zu den Zielen gehören räumlich-zeitliche Entrauschung im Pixel- oder latenten Raum sowie die Vorhersage des nächsten Tokens über visuelle Codes. Die Konditionierung kann Text, Schlüsselbilder, Bewegung, Masken oder Kamerasteuerungen umfassen.
So läuft die Inferenz
Das System erzeugt einen Clip als Ganzes oder in Fenstern, oft mit kaskadierter Verfeinerung. Eine längere Dauer, höhere Auflösung und stärkere zeitliche Kohärenz erhöhen den Rechen- und Speicherbedarf.
Stärken
- Text- oder Bild-konditionierte Bewegungssynthese
- Videoerweiterung, -interpolation und -bearbeitung
- Latente Darstellungen können die Kosten für rohe Pixel amortisieren
Zielkonflikte
- Identität und Objektpersistenz können im Laufe der Zeit abweichen
- Generierung und menschliche Überprüfung sind teuer
- Physik, Timing, lesbarer Text und synchronisierter Ton erfordern dedizierte Tests
Geeignet, wenn
- Kurze kreative Clips oder kontrollierte Transformationen
- Zeitliche Ausfallmodi sind in die Akzeptanzkriterien aufgenommen
- Asynchrone Generierung ist akzeptabel
Vermeiden oder hinterfragen, wenn
- Ein Echtzeit-deterministischer Renderer erforderlich ist
- Kontinuität oder physikalische Korrektheit nicht überprüft werden können
- Der Workflow unterstützt keine Herkunfts- und Einwilligungskontrollen
Beispielhafte veröffentlichte Familien
- • Video Diffusion Models Forschungsfamilie
- • Latente Video-Diffusion und Token-basierte Videogeneratoren
Häufig kombiniert mit
Latente DiffusionDiffusionstransformatoren (DiT)Autoregressive visuelle & Audio-ModelleMultimodale Fusionsmodelle