Loading...
Semantisches Caching(SCA)
Antworten des LLM oder Agenten zwischenspeichern, indexiert nach Embedding-Ähnlichkeit statt exakter Zeichenkettenübereinstimmung, sodass semantisch äquivalente Anfragen eine gespeicherte Antwort wiederverwenden. Ein Ähnlichkeitsschwellenwert entscheidet über einen Treffer, eine Aktualitäts-TTL begrenzt die Veralterung, und eine Invalidierungsrichtlinie entfernt Einträge, wenn sich die Quelldaten ändern. Das senkt Kosten und Latenz bei hohem Trafficaufkommen und unterscheidet sich vom Prompt-Präfix- oder KV-Caching.
In 30 seconds
- What
- Speichert LLM-Antworten anhand von Embedding-Ähnlichkeit statt exakter Textübereinstimmung und verwendet Antworten wieder, sobald eine neue Anfrage einen Ähnlichkeitsschwellenwert überschreitet.
- When to use
- Anfragelasten mit hohem Volumen, bei denen sich viele semantisch gleichwertige Fragen wiederholen und Kosten- oder Latenzsenkung wichtiger ist als Aktualität.
- Watch out
- Die Einstellung des Ähnlichkeitsschwellenwerts ist heikel: zu niedrig liefert veraltete Antworten zu abgedrifteten Themen, zu hoch verpasst gültige Cache-Treffer.
Loading technique guide…