首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >为什么大语言模型推理需要 KV 缓存?

为什么大语言模型推理需要 KV 缓存?

词条归属:KV 缓存机制

1. 自回归生成的重复计算问题

大语言模型以自回归方式逐 token 生成文本。在不使用缓存时,每生成一个新 token,都需要对提示词及此前已生成的所有历史 token 重新计算其键、值投影,再以此计算注意力分数。随着序列变长,这种"每步重算全部历史"的做法会让计算量随序列长度迅速膨胀,生成越长的回复,单步开销越大。

2. 缓存已计算状态以避免冗余

KV 缓存的思路是:历史 token 的键与值投影在首次计算完成后即被保留,后续生成新 token 时直接复用。模型只需为新到达的 token 计算一次投影,并让它去查询已缓存的全部历史键、值,即可完成当前步的注意力运算。这意味着每步新增的只是"一个新 token 的计算",历史部分不再重复。

3. 以空间换时间的本质价值

KV 缓存是一种典型的空间换时间策略:它通过占用额外的显存来保存中间状态,换取每步推理计算量的大幅下降。对于多轮对话、长文档生成、批量并发等场景,缓存带来的加速直接转化为更低的延迟与更高的吞吐,是生产级推理不可或缺的基础机制。

相关文章
AI大模型推理优化:KV缓存的“组合式复用”
随着大语言模型(LLM)在各行各业的广泛应用,其高昂的推理成本和显著的延迟已成为制约其规模化落地的主要瓶颈。在LLM的自回归特性中,高效复用“KV缓存”是降低成本、提升速度的关键。然而,您是否发现,在RAG(检索增强生成)、ReAct/RAISE或长期记忆等现代LLM应用场景中,传统的“基于前缀的KV缓存复用”方法正面临严峻挑战?这些应用往往需要动态、非连续地组合上下文,导致简单的前缀复用失效,进而不得不进行代价高昂的“完全重新计算”。本文将深入探讨这一“前缀假设”失效的困境,并介绍一种创新的“组合式复用”范式,以及它如何重塑LLM推理的效率边界,同时对底层存储系统提出哪些新的要求。
数据存储前沿技术
2025-11-20
1.1K0
大模型KV缓存,形象理解
https://medium.com/@prathamgrover777/kv-caching-attention-optimization-from-o-n%C2%B2-to-o-n-8b605f0d4072
Ai学习的老章
2025-11-20
1.1K0
大语言模型--KV Cache量化论文
论文地址:[2402.02750] KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache (arxiv.org)
aaronwjzhao
2024-05-30
2.1K0
麻省理工(MIT) | 提出跨层Attention,减少Transformer大模型键值(KV)缓存,加快LLM推理!
键值 (KV) 缓存能够显著提升Transformer大模型的解码速度。但是当面对长序列的时候,键值 (KV) 缓存需要大量的内存资源。当前减少键值 (KV) 缓存的两个主要方法分别为:Multi-Query Attention(MQA)和Grouped-Query Attention (GQA)。这两种方法主要是修改了Attention块,使得多头请求头共享单个KV头,从而大大减少了不同KV的数量。
ShuYini
2024-05-28
1.7K0
腾讯混元 & 东京工业大学 无损 KV 缓存压缩至2% ,护航大型语言模型推理!
大型语言模型(LLMs)已在各个领域广泛应用并得到验证,改变了作者收集和处理信息的方式,并影响了作者的日常生活。Driess等人(2023年);Zhang等人;Zhu等人;Wang等人(2024年)。最近,LLM的长文本推理和理解能力逐渐被认为对其能力至关重要,引起了越来越多的关注。开源和闭源LLM现在都在努力适应更长的 Token 长度,Achiam等人(2023年);DeepSeek-AI(2024年)。然而,这种长度扩展对LLM提出了关键的效率挑战,特别是与日益增长的键值(KV)缓存内存问题,这给更强大的LLM的部署带来了巨大的障碍。KV缓存技术,涉及从解码器仅有的Transformer多头自注意力(MHA)块(Vaswani等人,2017年)中缓存和重用已计算的键值向量,在大多数解码器仅有的LLM中广泛采用,以加速模型推理速度。
未来先知
2024-12-27
1.3K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券