モデルアーキテクチャ
テキストとチャット言語モデル
トークンごとにテキストを生成します。通常は、次トークンの予測のために訓練された因果デコーダを使用し、指示に従うように適応させます。
理解のためのモデル
会話プロトコルでラップされた確率的な継続エンジンであり、データベース、検索エンジン、または決定論的ルールエンジンではありません。
データフロー
- メッセージ、ドキュメント、またはコード
- トークナイザー + 役割/ツールマーカー
- 因果言語モデルバックボーン
- 次トークン分布
- 停止条件までデコード
学習方法
事前学習では通常、大規模なトークン列に対する次トークンのクロスエントロピーを最小化します。その後、指示チューニング、選好最適化、安全性学習、ツール使用例によって対話動作を整えますが、根拠と評価が必要であることは変わりません。
推論の実行方法
モデルは次のトークンを繰り返し予測し、サンプリングまたは選択します。KVキャッシュは過去のアテンション状態を再利用します。長い回答の生成は逐次的であり、デコード設定は出力のばらつきを変えても事実性を高めるものではありません。
強み
- 自由形式の文章作成、変換、説明、コード、会話
- コンテキスト内の指示と例からタスクを学習します
- 制約と検証を組み合わせれば、構造化されたツール呼び出しやスキーマを出力できる
トレードオフ
- 流暢だが裏付けのない主張を生み出す可能性があります
- 自己回帰的な出力によりトークンごとのレイテンシが追加されます
- コンテキスト、プロンプト、サンプリングの選択肢は動作に大きく影響します
適する場合
- タスクに柔軟な言語生成または合成が必要な場合
- ルーブリックと代表的な評価セットで許容可能な振る舞いを定義できる場合
- 新鮮な事実は検索またはツールを通じてグラウンドすることができます
避ける・再検討する場合
- 決定論的なパーサー、クエリ、またはルールエンジンがタスクを信頼性高く解決する場合
- 正確な現在の事実が必要だが、信頼できるソースに接続されていない場合
- レビューされていない出力が直接高影響度の操作を引き起こす可能性がある場合
公開された方式の例
- • GPT スタイルの因果言語モデル
- • InstructGPT 研究システムなどの指示調整された派生物
よく組み合わせる要素
DecoderのみのTransformer専門家混合モデル(MoE)検索拡張生成とハイブリッドシステムツール利用と推論システム