モデルアーキテクチャ
モデルアーキテクチャ実践ガイド
生成モデルのアーキテクチャ
テキスト、埋め込み、画像、動画、音声、マルチモーダル製品の内部構造を理解し、基盤、表現、生成器、システムの枠組みを目的に合わせて選びます。
22種類のアーキテクチャ · 5グループ · 各方式に個別ページ
最も重要な違い
機能とアーキテクチャは同じではない
「チャット」「画像」「マルチモーダル」はインターフェースを表します。Decoder-only、状態空間、DiT、MoEは内部計算を表し、RAGとツール利用はモデルを囲む実行時システムを表します。1つの本番システムが3種類すべての名称を持つこともあります。
= チャット機能
+ Decoder-only基盤
+ 検索と再ランキング
+ 型付きツール制御
+ ポリシーと人へのエスカレーション
アーキテクチャの設計票を作る
- 1機能: 入力、出力、利用者の目的、必要な根拠
- 2表現: トークン、ベクトル、画素、コーデック符号、連続潜在表現
- 3基盤: Encoder、Decoder、Seq2Seq、Attention、SSM、またはハイブリッド
- 4容量: 密結合または専門家ルーティング、総パラメータ数と有効パラメータ数
- 5生成: 自己回帰、拡散/フロー、敵対的、または決定論的
- 6システム: 検索、ツール、検証器、権限、監視、人による関与
全22方式を見る
各方式のページで、学習、推論、強み、トレードオフ、選択基準を確認できます。
製品機能
製品が受け入れ、そして出力する内容。これらは展開形態であり、相互に排他的なニューラルアーキテクチャではありません。
テキストとチャット言語モデル
トークンごとにテキストを生成します。通常は、次トークンの予測のために訓練された因果デコーダを使用し、指示に従うように適応させます。
埋め込みモデル
テキスト、画像、音声、ユーザー、またはアイテムをベクトルにマッピングし、その幾何形状は有用な類似性の概念を維持するように学習されます。
画像生成と編集
テキストや画像による条件付け、潜在生成器、画像デコーダを組み合わせて、画素を合成または変換します。
動画生成
フレーム、パッチ、または潜在表現によるビデオを、クロスフレーム計算を用いて空間と時間を同時に生成します。
オーディオ・音声・音楽モデル
タスク固有のパイプライン群:音声認識、音声合成、音声理解、声変換、音響生成、および音楽生成は単一のアーキテクチャではありません。
コアバックボーン
学習可能なネットワーク内での情報伝達経路。デプロイされたモデルは、これらの選択肢を複数組み合わせて使用することがあります。
エンコーダ専用Transformer
入力トークン全てが、両側のトークンに注意を払い、生成ループではなく文脈化された表現を生成します。
DecoderのみのTransformer
因果マスクを使用し、各位置が過去のトークンのみを参照することで、多くの汎用チャットモデルで使用される左から右への生成プロセスを模倣します。
Encoder–Decoder型Transformer
入力を双方向でエンコードし、その後、エンコードされたソースにクロスアテンションを行いながら、出力を因果的に生成します。
専門家混合モデル(MoE)
一部の密なサブレイヤーを多数のエキスパートネットワークと学習済みルーターに置き換え、各トークンではそのうち少数だけを有効にします。
状態空間モデルと再帰モデル
トークンが到着する際に明示的な位置ペア間の注意関係を保持するのではなく、コンパクトな状態を更新します。
表現と生成
画像、音声、動画などの高次元出力をどのように表現、学習、そしてサンプリングするか。
自己符号化器、VAE および学習済みトークナイザー
データを圧縮するエンコーダと、それを再構成するデコーダを学習します。変分および量子化されたバリエーションは、サンプリングまたは下流生成のために潜在空間を形成します。
敵対的生成ネットワーク(GAN)
生成器を識別器を欺くように訓練し、識別器は生成されたサンプルと訓練データを区別するように学習します。
正規化フロー
逐次的な可逆な写像によって、単純な分布を複雑なデータ分布に変換します。このとき、ヤコビアンは計算可能です。
拡散モデルとスコアベース生成
段階的なノイズ付加プロセスを逆転させることを学習し、ノイズをサンプルへと繰り返し変換することでデータを生成します。
潜在拡散モデル
自己符号化器の低次元潜在空間で拡散プロセスを実行し、生成された表現をピクセルまたは別の信号にデコードします。
拡散Transformer(DiT)
拡散型またはフローベースの生成プロセスにおけるノイズ除去ネットワークとして、ノイズの入った画像や動画パッチに対してTransformerを使用します。
自己回帰視覚・音声モデル
画像、動画、または音声を離散的なコードに変換し、順序立てて予測します。多くの場合、因果Transformerが用いられます。
モダリティインターフェース
視覚、テキスト、音声などのモダリティをどのように符号化、整合、融合し、生成器へ接続するか。
画像エンコーダ
画像を特徴マップ、パッチトークン、またはダウンストリームの分類器、検索器、デコーダ、あるいはマルチモーダルモデルが利用できるプーリングベクトルに変換します。
対照学習型/デュアルエンコーダ
クエリとドキュメント、または画像とキャプションなど、2つの入力を独立して符号化し、マッチングするペアが互いに近接するように学習します。
マルチモーダル融合モデル
射影、クロスアテンション、共有トークンスペース、またはこれらのメカニズムの組み合わせによって、モダリティ固有のエンコーダーとジェネレーターを接続します。
AIシステムアーキテクチャ
モデルを取り巻く実行時の仕組みであり、知識、ツール、制御、検証可能な振る舞いを追加します。