Loading...
🗂️
语义缓存(SCA)
以嵌入相似度而非精确字符串匹配作为键来缓存 LLM 或智能体的响应,使语义等价的查询能够复用已存储的答案。相似度阈值决定是否命中,新鲜度 TTL 限制过期程度,失效策略在源数据变化时清除条目。这可在高流量场景下降低成本和延迟,并且区别于提示前缀缓存或 KV 缓存。
复杂度: medium资源感知优化
In 30 seconds
- What
- 以嵌入相似度而非精确文本匹配为键缓存 LLM 响应,当新查询的相似度超过阈值时直接复用已有答案。
- When to use
- 高并发查询场景,大量语义等价的问题反复出现,且降低成本或延迟比内容时效性更重要。
- Watch out
- 相似度阈值的调校很脆弱:设得太低会在话题已经漂移时返回过时答案,设得太高又会错失本该命中的缓存。
Loading technique guide…