Loading...
Семантическое кэширование(SCA)
Кэширование ответов LLM или агента по ключу на основе сходства эмбеддингов, а не точного совпадения строк, чтобы семантически эквивалентные запросы повторно использовали сохранённый ответ. Порог сходства определяет попадание, TTL свежести ограничивает устаревание, а политика инвалидации удаляет записи при изменении исходных данных. Это снижает стоимость и задержку при высоконагруженном трафике и отличается от кэширования префикса промпта или KV-кэширования.
In 30 seconds
- What
- Кеширует ответы LLM по сходству эмбеддингов, а не по точному совпадению текста, и переиспользует ответ, когда новый запрос превышает порог сходства.
- When to use
- Высоконагруженные потоки запросов, где часто повторяются семантически эквивалентные вопросы, а снижение стоимости или задержки важнее свежести данных.
- Watch out
- Настройка порога сходства хрупка: слишком низкий порог выдаёт устаревшие ответы по сместившимся темам, слишком высокий упускает корректные попадания в кеш.
Loading technique guide…