Chargement des modèles…
Mise en cache sémantique(SCA)
Mettre en cache les réponses du LLM ou de l'agent en les indexant sur la similarité des embeddings plutôt que sur une correspondance exacte de chaîne, afin que des requêtes sémantiquement équivalentes réutilisent une réponse stockée. Un seuil de similarité détermine un succès, une TTL de fraîcheur limite l'obsolescence et une politique d'invalidation évince les entrées lorsque les données sources changent. Cela réduit le coût et la latence sur les trafics à fort volume et se distingue de la mise en cache du préfixe de prompt ou du cache KV.
Aperçu en 30 secondes
- Quoi
- Met en cache les réponses du LLM par similarité d'embeddings plutôt que par correspondance textuelle exacte, en réutilisant une réponse dès qu'une nouvelle requête dépasse un seuil de similarité.
- Quand l'utiliser
- Charges de requêtes à fort volume où de nombreuses questions sémantiquement équivalentes reviennent, et où la réduction du coût ou de la latence prime sur la fraîcheur.
- Vigilance
- Le réglage du seuil de similarité est fragile : trop bas, il renvoie des réponses obsolètes sur des sujets qui ont dérivé ; trop haut, il rate des correspondances valides.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Mise en cache sémantique: Vue d’ensemble
Mettre en cache les réponses du LLM ou de l'agent en les indexant sur la similarité des embeddings plutôt que sur une correspondance exacte de chaîne, afin que des requêtes sémantiquement équivalentes réutilisent une réponse stockée. Un seuil de similarité détermine un succès, une TTL de fraîcheur limite l'obsolescence et une politique d'invalidation évince les entrées lorsque les données sources changent. Cela réduit le coût et la latence sur les trafics à fort volume et se distingue de la mise en cache du préfixe de prompt ou du cache KV.
- Embedding-similarity cache keys
- Tunable similarity threshold for hits
- Freshness TTL to bound staleness
- Invalidation on source-data change
- Vector store backed lookup
- Cost and latency reduction at high volume
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
Par l’ingénieur derrière ce catalogue
Faites auditer l’architecture de vos agents
Cette page documente un pattern. Votre système en fait tourner des dizaines, et l’essentiel des pannes se loge dans la façon dont ils s’articulent. Faites relire toute la conception à l’aune des 288 patterns de ce catalogue : architecture, fiabilité, évaluation et coûts, chaque constat relié au pattern qui le corrige.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre