LLM 缓存的四个层次:KV、Prefix、Prompt 与 Semantic Cache
从一次自回归推理出发,区分 KV Cache、Prefix Caching、托管 API 的 Prompt Caching 与应用层 Semantic Cache,说明它们分别缓存什么、何时命中、节省哪段计算,以及生产环境最容易踩中的失效与正确性风险。
1 篇相关记录
从一次自回归推理出发,区分 KV Cache、Prefix Caching、托管 API 的 Prompt Caching 与应用层 Semantic Cache,说明它们分别缓存什么、何时命中、节省哪段计算,以及生产环境最容易踩中的失效与正确性风险。