モデルアーキテクチャ
画像エンコーダ
画像を特徴マップ、パッチトークン、またはダウンストリームの分類器、検索器、デコーダ、あるいはマルチモーダルモデルが利用できるプーリングベクトルに変換します。
理解のためのモデル
視覚情報を読み取る機能を持つモジュールです。表現を生成し、生成にはデコーダや生成モデルが必要です。
データフロー
- 画像またはフレーム
- パッチ、畳み込み、またはハイブリッドな入力部
- ビジョンバックボーン
- 空間トークン / 特徴ピラミッド / プーリングベクトル
- タスクヘッドまたはモダリティコネクタ
学習方法
教師ありラベル、マスクド・イメージ・モデリング、自己蒸留、再構成、および画像テキスト対照的な目的により、様々な視覚的変化不変性と空間の詳細レベルが生成されます。
推論の実行方法
エンコーダは、画像またはフレームのバッチごとに一度実行されます。プーリング出力は検索と分類に好ましく、密なトークンマップは検出やマルチモーダル推論のために多くの位置情報の詳細を保持します。
強み
- 再利用可能な視覚的特徴
- 効率的な分類、検索、認識
- プロジェクターまたはクロスアテンションによって画像を言語モデルに接続できます
トレードオフ
- 解像度とパッチサイズは、失われる詳細とトークンコストを決定します
- 学習目的により様々な盲点が作成されます
- プーリングベクトルは多くの空間タスクには不十分です
適する場合
- システムが視覚コンテンツを理解または検索する必要がある場合
- プールされた特徴と空間的特徴を選択するタスクによって判断できます
- 小さなテキスト、グラフ、およびドメイン画像が明示的に評価される場合
避ける・再検討する場合
- エンコーダ単体で誤って視覚生成が期待される場合
- 入力解像度が必須の詳細を取り除く場合
- 一般的な画像ベンチマークが実際のドメインに代わる場合
公開された方式の例
- • Vision Transformer (ViT)
- • 畳み込みおよび階層的なビジョンバックボーン
- • CLIPにおける画像タワー
よく組み合わせる要素
対照学習型/デュアルエンコーダマルチモーダル融合モデル画像および動画ジェネレータ