モデルアーキテクチャ
マルチモーダル融合モデル
射影、クロスアテンション、共有トークンスペース、またはこれらのメカニズムの組み合わせによって、モダリティ固有のエンコーダーとジェネレーターを接続します。
理解のためのモデル
“多様性”は入力および出力を示すものであり、特定のトポロジーを指すものではありません。常に、モダリティがどこで符号化され、融合され、デコードされるかを問う必要があります。
データフロー
- テキスト / 画像 / 音声 / 動画
- モダリティエンコーダーまたはトークナイザー
- プロジェクター、クロスアテンション、または共有バックボーン
- 結合表現 / 言語デコーダー
- テキスト、メディア、またはアクション出力
学習方法
システムは対照学習による整合、キャプション生成または次のトークンの尤度推定、マスクされた目的関数、ペアの指示データなどを組み合わせます。また、場合によっては、事前に学習済みの固定コンポーネントを個別に使用することもあります。
推論の実行方法
入力はモダリティトークンまたは特徴量に符号化され、言語/生成バックボーン内または前で融合され、1つ以上のモダリティにデコードされます。入力の理解が必ずしも出力の生成を意味するとは限りません。
強み
- 言語を視覚的または聴覚的な入力に基づいて基盤付けします
- ドキュメント、グラフ、画像、動画、音声ワークフローをサポートします
- 強力な事前学習済みモダリティコンポーネントを再利用できます
トレードオフ
- モダリティの不均衡とコネクタボトルネック
- メディアトークンは多大なコンテキストと計算リソースを消費します
- 評価は、知覚、基盤付け、推論、生成を分離する必要があります
適する場合
- タスクが実際に非テキストエビデンスに依存する場合
- モダリティ固有のスライスと拒否処理が評価される場合
- アーキテクチャがコストおよびプライバシーのレビューに必要な十分な詳細を公開する場合
避ける・再検討する場合
- 文字起こし、OCR結果、または構造化された抽出器で十分な場合
- “画像に対応している”とは正確な知覚を意味すると仮定されている場合
- 機密メディアの取り扱いと保持が未定義の場合
公開された方式の例
- • Flamingo のクロスアテンションアーキテクチャ
- • BLIP-2 の学習済みクエリコネクタ
- • 共有トークンによる多モダリティデコーダーシステム
よく組み合わせる要素
Vision / 音声エンコーダーDecoderのみのTransformer対照学習による整合メディアジェネレーター