前缀缓存并非独立于 KV 缓存的另一套存储,而是对 KV 缓存的管理策略:它将多个请求共享的提示词前缀(如系统提示词、检索上下文、少样本示例)对应的 KV 状态计算一次后持久化缓存,供后续共享该前缀的请求直接复用。
KV 缓存是承载键、值的中间状态存储,前缀缓存是在此之上决定"哪些 KV 状态可跨请求保留与共享"的策略。二者是存储机制与调度策略的关系,前缀缓存使 KV 缓存的投入在共享前缀场景中产生更大回报。
vLLM 提供自动前缀缓存(Automatic Prefix Caching),SGLang 通过 RadixAttention 以基数树组织并复用共享前缀的 KV 缓存。它们都建立在 KV 缓存之上,避免对相同前缀反复做 Prefill 计算,从而降低延迟、提升吞吐。