首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >前缀缓存(Prefix Caching)和 KV 缓存是什么关系?

前缀缓存(Prefix Caching)和 KV 缓存是什么关系?

词条归属:KV 缓存机制

1. 前缀缓存是建立在 KV 缓存之上的复用策略

前缀缓存并非独立于 KV 缓存的另一套存储,而是对 KV 缓存的管理策略:它将多个请求共享的提示词前缀(如系统提示词、检索上下文、少样本示例)对应的 KV 状态计算一次后持久化缓存,供后续共享该前缀的请求直接复用。

2. KV 缓存提供底层存储,前缀缓存提供复用策略

KV 缓存是承载键、值的中间状态存储,前缀缓存是在此之上决定"哪些 KV 状态可跨请求保留与共享"的策略。二者是存储机制与调度策略的关系,前缀缓存使 KV 缓存的投入在共享前缀场景中产生更大回报。

3. 主流引擎的实现形态

vLLM 提供自动前缀缓存(Automatic Prefix Caching),SGLang 通过 RadixAttention 以基数树组织并复用共享前缀的 KV 缓存。它们都建立在 KV 缓存之上,避免对相同前缀反复做 Prefill 计算,从而降低延迟、提升吞吐。

相关文章
springboot缓存之@Caching和@CacheConfig注解
在执行Localhost:8080/emp/lastName/jack请求之后,会同时将@CachePut缓存规则加入到缓存中。
西西嘛呦
2020-08-26
4.2K0
原理&图解vLLM Automatic Prefix Cache(RadixAttention)首Token时延优化
来源丨https://zhuanlan.zhihu.com/p/693556044
BBuf
2024-06-04
15.7K0
Prefix Caching 详解:实现 KV Cache 的跨请求高效复用
前缀缓存(Prefix Caching)是一种大语言模型推理优化技术,它的核心思想是缓存历史对话中的 KV Cache,以便后续请求能直接重用这些中间结果。这样可以显著降低首 token 延迟,提升整体推理效率。Prefix Caching 尤其适用于多轮对话、长文档问答等高前缀复用场景。
Se7en258
2025-06-09
5.8K0
Volatile和高速缓存的关系
很多工程师容易把volatile关键字,当成和锁或者数据数据原子性相关的知识点。volatile最核心要关系JMM。
JavaEdge
2022-12-18
1.1K1
AI大模型推理优化:KV缓存的“组合式复用”
随着大语言模型(LLM)在各行各业的广泛应用,其高昂的推理成本和显著的延迟已成为制约其规模化落地的主要瓶颈。在LLM的自回归特性中,高效复用“KV缓存”是降低成本、提升速度的关键。然而,您是否发现,在RAG(检索增强生成)、ReAct/RAISE或长期记忆等现代LLM应用场景中,传统的“基于前缀的KV缓存复用”方法正面临严峻挑战?这些应用往往需要动态、非连续地组合上下文,导致简单的前缀复用失效,进而不得不进行代价高昂的“完全重新计算”。本文将深入探讨这一“前缀假设”失效的困境,并介绍一种创新的“组合式复用”范式,以及它如何重塑LLM推理的效率边界,同时对底层存储系统提出哪些新的要求。
数据存储前沿技术
2025-11-20
1.1K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券