パターンを読み込んでいます…
セマンティックキャッシュ(SCA)
完全一致の文字列照合ではなく埋め込みの類似度をキーとしてLLMやエージェントの応答をキャッシュし、意味的に等価なクエリが保存済みの回答を再利用できるようにする。類似度のしきい値でヒットを判定し、鮮度のTTLで陳腐化を抑え、無効化ポリシーでソースデータの変更時にエントリを破棄する。これにより大量トラフィックでのコストとレイテンシを削減でき、プロンプト接頭辞キャッシュやKVキャッシュとは区別される。
30秒でわかる概要
- 概要
- 完全一致のテキスト照合ではなく埋め込みの類似度で LLM の応答をキャッシュし、新しいクエリが類似度のしきい値を超えたら既存の回答を再利用します。
- 使いどころ
- 意味的に同等な質問が何度も繰り返される大量アクセスの環境で、鮮度よりもコストやレイテンシの削減を優先したい場合。
- 注意点
- 類似度のしきい値の調整は繊細です。低すぎると話題がずれた問いに古い回答を返し、高すぎると本来有効なキャッシュヒットを取り逃がします。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
セマンティックキャッシュ: 概要
完全一致の文字列照合ではなく埋め込みの類似度をキーとしてLLMやエージェントの応答をキャッシュし、意味的に等価なクエリが保存済みの回答を再利用できるようにする。類似度のしきい値でヒットを判定し、鮮度のTTLで陳腐化を抑え、無効化ポリシーでソースデータの変更時にエントリを破棄する。これにより大量トラフィックでのコストとレイテンシを削減でき、プロンプト接頭辞キャッシュやKVキャッシュとは区別される。
- Embedding-similarity cache keys
- Tunable similarity threshold for hits
- Freshness TTL to bound staleness
- Invalidation on source-data change
- Vector store backed lookup
- Cost and latency reduction at high volume
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで