正在加载模式…
🗂️
语义缓存(SCA)
以嵌入相似度而非精确字符串匹配作为键来缓存 LLM 或智能体的响应,使语义等价的查询能够复用已存储的答案。相似度阈值决定是否命中,新鲜度 TTL 限制过期程度,失效策略在源数据变化时清除条目。这可在高流量场景下降低成本和延迟,并且区别于提示前缀缓存或 KV 缓存。
复杂度: medium资源感知优化
30秒速览
- 是什么
- 以嵌入相似度而非精确文本匹配为键缓存 LLM 响应,当新查询的相似度超过阈值时直接复用已有答案。
- 何时使用
- 高并发查询场景,大量语义等价的问题反复出现,且降低成本或延迟比内容时效性更重要。
- 注意
- 相似度阈值的调校很脆弱:设得太低会在话题已经漂移时返回过时答案,设得太高又会错失本该命中的缓存。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
语义缓存: 概览
以嵌入相似度而非精确字符串匹配作为键来缓存 LLM 或智能体的响应,使语义等价的查询能够复用已存储的答案。相似度阈值决定是否命中,新鲜度 TTL 限制过期程度,失效策略在源数据变化时清除条目。这可在高流量场景下降低成本和延迟,并且区别于提示前缀缓存或 KV 缓存。
- Embedding-similarity cache keys
- Tunable similarity threshold for hits
- Freshness TTL to bound staleness
- Invalidation on source-data change
- Vector store backed lookup
- Cost and latency reduction at high volume
The Agent Architect
每周一个模式、一个权衡、一个生产事故案例。为构建智能体系统的人准备的每周简报。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前