モデルアーキテクチャ
エンコーダ専用Transformer
入力トークン全てが、両側のトークンに注意を払い、生成ループではなく文脈化された表現を生成します。
理解のためのモデル
入力を全体として読み込み、各位置の文脈を解釈し、その後プーリングまたはタスクヘッドを付与します。
データフロー
- トークンシーケンス
- 双方向自己注意ブロック
- 文脈化されたトークン状態
- プーラーまたはタスクヘッド
- クラス、スパン、スコア、またはベクトル
学習方法
マスクされたトークンの再構成が典型的な事前学習目的であり、その後、タスク固有の分類、トークンラベリング、スパン予測、またはメトリック学習が行われます。
推論の実行方法
1回の順伝播で利用可能な入力を処理します。理解と表現に適していますが、それ自体では任意の内容を生成しません。
強み
- 分類および抽出のための豊富な双方向コンテキスト
- 入力全体にわたる並列処理
- 大量の境界付きタスクに対して効率的である場合が多い
トレードオフ
- 開放型ジェネレータではない
- 最大入力長と二次注意が長いドキュメントを制限する可能性がある
- 通常、タスクヘッドまたはプーリング戦略が必要
適する場合
- 分類、固有表現抽出、再ランキング、または埋め込みが優勢である
- 予測前に完全な入力が利用可能である
- より小さく専門化されたモデルが基準を満たすことができる
避ける・再検討する場合
- 主要出力が長い自由形式のテキストである
- ストリーミング生成が必要である
- 入力が評価されたコンテキスト戦略を定期的に超える
公開された方式の例
- • BERTおよびRoBERTaリサーチファミリー
- • エンコーダベースのリランカーと分類器
よく組み合わせる要素
埋め込みモデル画像エンコーダ対照学習型/デュアルエンコーダ検索拡張生成とハイブリッドシステム