モデルアーキテクチャ
動画生成
フレーム、パッチ、または潜在表現によるビデオを、クロスフレーム計算を用いて空間と時間を同時に生成します。
理解のためのモデル
画像生成に時間軸を加えたものであり、それにより一貫性、記憶、動き、評価といった問題をより大規模なものにします。
データフロー
- テキスト、画像、または動画条件
- 時空間表現
- 時間的拡散またはトークンジェネレーター
- ビデオデコーダー / アップサンプラー
- フレーム + 音声アライメントチェック
学習方法
目的には、ピクセル空間または潜在空間における時空間ノイズ除去と、視覚コードに対する次のトークンの予測が含まれます。条件付けには、テキスト、キーフレーム、モーション、マスク、またはカメラコントロールを含めることができます。
推論の実行方法
システムは、クリップをまとめて、あるいはウィンドウごとにサンプリングします。多くの場合、カスケードによるリファインメントが用いられます。より長い持続時間、より高い解像度、そしてより強い時間的コヒーレンスは、計算量とメモリへの負荷を増加させます。
強み
- テキストまたは画像条件付きのモーションシンセシス
- ビデオ拡張、補間、編集
- 潜在表現により、生のピクセルのコストを相殺できます
トレードオフ
- 同一性やオブジェクトの永続性が時間とともに変化する可能性がある
- 生成と人間によるレビューにコストがかかる
- 物理法則、タイミング、読みやすいテキスト、そして同期音声には専用テストが必要
適する場合
- 短いクリエイティブなクリップや制御された変換
- 時間に関する失敗モードが許容基準に含まれる
- 非同期生成が可能
避ける・再検討する場合
- リアルタイムの決定論的レンダラーが必要
- 連続性または物理的な正確性をレビューできない
- ワークフローがプロヴェナンスと同意管理をサポートできない
公開された方式の例
- • Video Diffusion Models リサーチファミリー
- • 潜在ビデオ拡散およびトークンベースのビデオジェネレーター
よく組み合わせる要素
潜在拡散モデル拡散Transformer(DiT)自己回帰視覚・音声モデルマルチモーダル融合モデル