Reddit
Как проверить, что кэширование общих префиксов запросов действительно работает?
Автор делится опытом оптимизации кэширования префиксов при работе с LLM API: динамические идентификаторы запросов в начале промпта ломали кэш, заставляя провайдера повторно обрабатывать тысячи общих токенов. После стабилизации ключей кэширования возник вопрос — как достоверно валидировать, что экономия достигается именно за счёт cache hits, а не из-за изменений в трафике.
score 40r/AI_Agents