Muster werden geladen…
Semantisches Caching(SCA)
Antworten des LLM oder Agenten zwischenspeichern, indexiert nach Embedding-Ähnlichkeit statt exakter Zeichenkettenübereinstimmung, sodass semantisch äquivalente Anfragen eine gespeicherte Antwort wiederverwenden. Ein Ähnlichkeitsschwellenwert entscheidet über einen Treffer, eine Aktualitäts-TTL begrenzt die Veralterung, und eine Invalidierungsrichtlinie entfernt Einträge, wenn sich die Quelldaten ändern. Das senkt Kosten und Latenz bei hohem Trafficaufkommen und unterscheidet sich vom Prompt-Präfix- oder KV-Caching.
In 30 Sekunden
- Was
- Speichert LLM-Antworten anhand von Embedding-Ähnlichkeit statt exakter Textübereinstimmung und verwendet Antworten wieder, sobald eine neue Anfrage einen Ähnlichkeitsschwellenwert überschreitet.
- Wann einsetzen
- Anfragelasten mit hohem Volumen, bei denen sich viele semantisch gleichwertige Fragen wiederholen und Kosten- oder Latenzsenkung wichtiger ist als Aktualität.
- Achtung
- Die Einstellung des Ähnlichkeitsschwellenwerts ist heikel: zu niedrig liefert veraltete Antworten zu abgedrifteten Themen, zu hoch verpasst gültige Cache-Treffer.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Semantisches Caching: Überblick
Antworten des LLM oder Agenten zwischenspeichern, indexiert nach Embedding-Ähnlichkeit statt exakter Zeichenkettenübereinstimmung, sodass semantisch äquivalente Anfragen eine gespeicherte Antwort wiederverwenden. Ein Ähnlichkeitsschwellenwert entscheidet über einen Treffer, eine Aktualitäts-TTL begrenzt die Veralterung, und eine Invalidierungsrichtlinie entfernt Einträge, wenn sich die Quelldaten ändern. Das senkt Kosten und Latenz bei hohem Trafficaufkommen und unterscheidet sich vom Prompt-Präfix- oder KV-Caching.
- Embedding-similarity cache keys
- Tunable similarity threshold for hits
- Freshness TTL to bound staleness
- Invalidation on source-data change
- Vector store backed lookup
- Cost and latency reduction at high volume
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihre Agenten-Architektur prüfen
Diese Seite dokumentiert ein Pattern. Ihr System betreibt Dutzende, und die meisten Ausfälle entstehen im Zusammenspiel. Lassen Sie den gesamten Entwurf an den 288 Patterns dieses Katalogs messen: Architektur, Zuverlässigkeit, Evaluation und Kosten, jeder Befund verknüpft mit dem Pattern, das ihn behebt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September