モデルアーキテクチャ
検索拡張生成とハイブリッドシステム
モデルパラメータに依存するのではなく、リクエスト時に証拠を取得し、ジェネレータ、分類器、またはエージェントに提供します。
理解のためのモデル
オープンブック推論:検索が証拠を選択し、生成がそれを利用します。各要素は独立して失敗する可能性があります。
データフロー
- 取り込み → チャンク分割 → インデックス作成
- ユーザーからの問い合わせ
- 密・疎・グラフ、またはハイブリッドな検索
- 再ランキング + コンテキストアセンブリ
- 根拠となる情報を参照したモデルによる回答
学習方法
コンポーネントは個別にトレーニングすることも、共同でトレーニングすることもできます。デュアルエンコーダは検索を学習し、再ランキングシステムはペアごとの関連性を学習し、ジェネレータは文脈に即した応答行動を学習します。多くの実用的なRAGシステムでは、エンドツーエンドのトレーニングなしで事前学習済みのコンポーネントを使用します。
推論の実行方法
クエリ書き換えまたはルーティングが行われる場合があります。複数の検索器が候補を作成し、フィルタと再ランキングシステムが証拠を選択します。モデルは境界付きコンテキストから回答を生成します。参照の正確性を確保するには、主張が実際に裏付けられていることを確認する必要があります。
強み
- 重み更新なしで最新の、機密性の高い、または帰属可能な知識
- 証拠を検査・アクセス制御可能
- インデックスとジェネレータは独立して進化させることが可能
トレードオフ
- 不適切なチャンク分割や検索により、欠落した証拠からの確信的な回答が生成される
- 取り込みの鮮度、権限、および削除が本番環境システムの課題になる
- 取得されたコンテンツにはプロンプトインジェクションや汚染データが含まれる可能性がある
適する場合
- 回答が変化するまたは独自のソースに依存する場合
- ユーザーが追跡可能な証拠を必要とする場合
- 検索、ランキング、根拠付け、および回答品質を個別に評価できる場合
避ける・再検討する場合
- コーパスが決定論的な参照で十分なほど小さい場合
- 信頼できる情報源が存在しない場合
- ベクトルデータベースの追加が完全なRAG設計として扱われる場合
公開された方式の例
- • オリジナルの検索拡張生成アーキテクチャ
- • 再ランキングによる密・疎ハイブリッド検索
- • グラフまたはツールベースの検索パイプライン
よく組み合わせる要素
埋め込みモデル対照学習型/デュアルエンコーダ再ランキングシステムテキストとチャット言語モデルツール利用と推論システム