首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >KV 缓存把注意力计算复杂度从多少降到了多少?

KV 缓存把注意力计算复杂度从多少降到了多少?

词条归属:KV 缓存机制

1. 单步生成复杂度的下降

在不使用缓存时,生成第 n 个 token 必须重新投影此前所有 n-1 个 token 的键、值并重算注意力,单步注意力计算量约为 O(n²)(n 为已生成序列长度)。引入 KV 缓存后,每步只需为新 token 计算一次投影,再与长度为 n 的缓存做注意力,单步复杂度降为 O(n)。

2. 整段序列生成总复杂度的下降

从生成整段长度为 n 的序列看,无缓存时每步 O(n²) 累计约为 O(n³),缓存后每步 O(n) 累计约为 O(n²)。也就是说,KV 缓存将序列生成的总注意力计算从 O(n³) 量级压低到 O(n²) 量级,并消除了随序列长度增长的重复计算。

3. 复杂度下降的现实意义

这一量级下降直接对应延迟的改善:短回复时收益有限,但当序列达到数千乃至数十万 token 时,无缓存方案几乎不可行,而缓存方案使长文本生成保持在可接受的线性增长轨道上。

相关文章
大模型上下文成本与注意力优化技术深度解析——为何O(n²)平方复杂度无法被常规优化消除
在大模型落地、推理成本优化、长上下文模型选型的工程实践中,一直流传一句经典结论:大模型 Token 成本随上下文长度呈 O(n²) 平方上涨,128K 上下文相比 8K 上下文成本会暴涨几十倍。
微学AI
2026-08-13
1720
【直播笔记】十问腾讯混元快思考模型Turbo S
除了快,作为腾讯混元最新旗舰模型,混元Turbo S在技术上还有哪些创新?为什么采用了融合的Hybrid Mamba Transformer结构?对于大模型的快与慢的优劣势,技术团队都有哪些思考?在这场对话中,混元团队带来全面的解读。
腾讯云开发者
2025-03-19
1.6K0
Ollama 跑不动模型?先算一下显存到底要多少
其实 Ollama 这笔账不难算。搞清楚占显存的到底是哪几部分,选模型时心里就有数了。
PC电脑医生
2026-09-20
1110
中国AI又赢了!成本砍到前代1/10!DeepSeek V4为什么能这么便宜?
为什么只有DeepSeek,敢把百万上下文做成全系列标配,甚至把模型权重全量开源开放给所有人用?
企业架构师老王
2026-04-27
9820
注意力机制进化史:从MHA到MoBA,新一代注意力机制的极限突破!
MLA主要通过优化KV-cache来减少显存占用,从而提升推理性能。直接抛出这个结论可能不太好理解。首先我们来看下,对于生成模型,一个完整的推理阶段是什么样的,推理性能上有什么问题。这部分内容主要来自:
致Great
2025-02-21
2K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券