首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >KV 缓存利用了自注意力机制的什么数学特性?

KV 缓存利用了自注意力机制的什么数学特性?

词条归属:KV 缓存机制

1. 注意力的可分解性与历史无关性

自注意力计算中,第 t 个 token 的输出仅依赖于当前 token 的查询(Query)与所有历史 token 的键、值。已生成 token 的键、值一旦算出,就不再随后续 token 的生成而改变——这一"历史表示与未来无关"的数学特性,使得缓存下来的键、值可以被任意后续步安全复用,无需重新计算。

2. 线性投影结果的确定性

键、值由输入表示经固定的线性投影(乘以权重矩阵 W_K、W_V)得到,是确定性的函数输出。只要输入 token 不变,其键、值就唯一确定,因此缓存具有完全一致的正确性保障,不会因为复用而产生近似误差。

3. 因果掩码下只需向后查询

在因果语言建模的注意力中,当前 token 只能关注其自身及之前的 token(因果掩码)。由于查询方向始终是"当前指向历史",历史键、值天然构成可被持续追加与复用的缓存,这正是 KV 缓存在解码阶段成立的数学前提。

相关文章
大语言模型---什么是注意力机制?LlaMA 中注意力机制的数学定义
注意力机制(Attention Mechanism)是一种在深度学习和人工智能中广泛使用的技术,旨在使模型在处理信息时能够重点关注重要的部分,从而提升任务的效率和精度。它最初应用于自然语言处理(NLP),并迅速扩展到计算机视觉(CV)、语音处理等领域。
非那雄胺消费者
2024-11-25
1K0
为什么出现Transformer:传统RNN的问题;Attention(注意力机制)和Self-Attention(自注意力机制)区别
​推荐文章:深入探索MyBatis-Plus:高效实现字段模糊查询的秘诀-腾讯云开发者社区-腾讯云
zhangjiqun
2024-11-19
6530
SSM+扩散模型,竟造出一种全新的「视频世界模型」
在这个 AI 技术与应用大爆发的时代,我们最不缺的就是「热词」,从自回归到扩散模型,从注意力机制到状态空间模型,从思维链到推理模型…… 有时候,其中一些热词会聚拢一处,为 AI 世界创造出新的可能性。
机器之心
2025-06-10
5240
图解KV Cache:解锁LLM推理效率的关键
LLM 用于推理的时候就是不断基于前面的所有 token 生成下一个 token。
致Great
2025-03-04
4.6K0
万字详解:谷歌研究院推出的TurboQuant压缩算法 —— 极致压缩如何重塑大模型推理的未来
2026 年,生成式人工智能已进入“长上下文时代”。从 Claude 3 的 200K tokens 到 Gemini 2 的 1M tokens,大语言模型(LLM)的上下文窗口正以指数级速度扩张。然而,这一进步背后隐藏着一个严峻挑战:键值缓存(Key-Value Cache, KV Cache)的内存爆炸。
jack.yang
2026-03-26
8.3K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券