モデルアーキテクチャ
自己回帰視覚・音声モデル
画像、動画、または音声を離散的なコードに変換し、順序立てて予測します。多くの場合、因果Transformerが用いられます。
理解のためのモデル
メディアを言語のように扱う:トークン化し、順序を選択し、次のコードを予測し、その後デコードする。
データフロー
- メディアトークナイザー / コーデック
- 順序付けされた離散コード
- 因果トークンモデル
- 生成されたコードシーケンス
- メディアデコーダー
学習方法
再構成のための学習済みコーデックが訓練され、先行の最小化は次のコードのクロスエントロピーであり、テキスト、以前のフレーム、セマンティックトークン、または粗視程コードに基づいて条件付けされる場合がある。
推論の実行方法
コードは直列または階層的/ブロックごとのスケジュールで生成され、その後デコードされます。順序はレイテンシを決定し、依存関係が容易にモデル化できるようにします。
強み
- モダリティを超えたトークンベースの統一的なモデリング
- 因果言語モデルインフラストラクチャとの互換性
- 選択されたトークン化による正確な離散尤度
トレードオフ
- 長いコードシーケンスは直列レイテンシを生じさせる
- トークナイザーアーティファクトは出力品質に制限を与える
- 一次元の順序付けは空間的またはマルチスケール構造に対してぎこちなくなる可能性がある
適する場合
- 強力な離散コーデックが存在する
- クロスモーダルトークンモデリングまたは継続が重要である
- 階層的な生成がレイテンシの目標を満たすことができる
避ける・再検討する場合
- 長い直列デコードが予算を過ぎる
- コーデックが重要な知覚的詳細を失う
- 連続拡散表現の方が大幅に単純である
公開された方式の例
- • ImageGPTスタイルのピクセル/トークンモデリング
- • VQ-トークンイメージジェネレーター
- • AudioLMスタイルのコーデック・トークン階層
よく組み合わせる要素
DecoderのみのTransformerVQ-VAE / ニューラルコーデックマルチモーダルトークン融合