モデルアーキテクチャ
状態空間モデルと再帰モデル
トークンが到着する際に明示的な位置ペア間の注意関係を保持するのではなく、コンパクトな状態を更新します。
理解のためのモデル
学習された状態遷移によってシーケンスをストリーミングし、状態は過去の圧縮された記憶です。
データフロー
- 現在のトークン + 以前の状態
- 学習された状態更新
- 選択的ゲートまたは再帰的なミキサー
- 出力隠れ状態
- 状態を順伝播
学習方法
系列モデリング損失は、再帰または構造化された状態空間層と組み合わされます。並列スキャンや関連する定式化により、ナイーヴなステップごとのRNNよりもトレーニングを並列化できます。
推論の実行方法
デコードでは、レイヤーごとに境界付きの再帰状態を維持します。ハイブリッドアーキテクチャは、各メカニズムがうまく処理できる状態空間、畳み込み、注意層を交互に使用する場合があります。
強み
- コアとなる再帰演算における線形時間シーケンス処理
- 推論時のコンパクトなストリーミング状態
- 長期間または継続的に到着するシーケンスとの自然な適合性
トレードオフ
- 圧縮された状態は、正確な遠隔の詳細を失う可能性がある
- ツールと最適化されたカーネルは、標準的な注意メカニズムよりも成熟度が低い場合がある
- アーキテクチャレベルの複雑さに関する主張は、エンドツーエンドで検証する必要がある
適する場合
- ストリーミングまたは長期間シーケンス効率が最優先事項である場合
- ターゲットとなる実行環境に最適化されたカーネルが存在する場合
- 再現性、品質、スループットを実際のワークロードでベンチマークする場合
避ける・再検討する場合
- 長期間のコンテキストから正確な任意の情報を取得できると想定される場合(テストなしに)
- サービススタックがこのアーキテクチャを活用できない場合
- 成熟したTransformerデプロイメントですでに予算内に収まっている場合
公開された方式の例
- • Mamba選択的状態空間モデル
- • RWKVスタイルの再帰言語モデル
- • ハイブリッド注意–SSMスタック
よく組み合わせる要素
DecoderのみのTransformer専門家混合モデル(MoE)ハイブリッド注意レイヤー