首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >滑动窗口注意力(SWA)如何为 KV 缓存设置内存上限?

滑动窗口注意力(SWA)如何为 KV 缓存设置内存上限?

词条归属:KV 缓存机制

1. 限制每 token 的注意力跨度

滑动窗口注意力(SWA,如 Mistral 7B 所采用)让每个 token 只关注其之前的固定窗口大小 w 个 token,而非整个历史序列。注意力范围被限制在局部窗口内,不再随序列总长的增长而扩展。

2. 缓存只需保留最近窗口

由于只关注最近 w 个 token,KV 缓存每层只需保留最近 w 个 token 的键、值,缓存占用被限定为 w × 单 token 大小,与整段序列的总长度无关,从而为显存设置了一个固定上限。

3. 以有限内存换取可扩展长度

SWA 通过限制单层的直接注意力范围,用可控的内存代价支持更长的表层序列;超出窗口的历史信息可经由多层堆叠的感知野间接传递。其代价是单层无法直连任意远处 token,需在任务效果与内存上限之间权衡。

相关文章
字节Seed团队PHD-Transformer突破预训练长度扩展!破解KV缓存膨胀难题
最近,DeepSeek-R1 和 OpenAI o1/03 等推理大模型在后训练阶段探索了长度扩展(length scaling),通过强化学习(比如 PPO、GPRO)训练模型生成很长的推理链(CoT),并在奥数等高难度推理任务上取得了显著的效果提升。
机器之心
2025-04-30
6780
小米 MiMo-V2.5系列API永久降价的技术分析(二)
1:7 Full:SWA相对激进稀疏比的混合注意力设计,用约 15% 的头负责长距离的信息召回(召回头),注重Full Attention 就能维持模型的长程理解能力,约 85% 的注意力头天然只关注局部信息(流式头),追求极致推理效率。
A小码哥
2026-06-09
4690
KV缓存:LLM推理的“内存怪兽”与优化之道
在生成式AI飞速发展的今天,大型语言模型(LLM)已成为驱动创新的核心引擎。然而,支撑这些模型高效运行的背后,隐藏着一个至关重要的技术——键值缓存(KV Cache)。它如同LLM推理过程中的“隐形引擎”,通过存储注意力机制的中间状态,极大地加速了文本生成的速度,将原本复杂的计算复杂度从二次方降低到线性。但与此同时,KV缓存也像一个“内存怪兽”,其巨大的内存占用迅速成为制约模型吞吐量、上下文长度和并发处理能力的关键瓶颈。从最初解决计算瓶颈到如今引发内存挑战,KV缓存的演进深刻揭示了AI系统设计中计算与内存之间的动态博弈。那么,这个“内存怪兽”究竟是如何工作的?它又带来了哪些不为人知的系统性挑战?我们又该如何驾驭它,释放LLM的全部潜能?本文将带您深入解析KV缓存的原理、挑战与前沿优化技术。
数据存储前沿技术
2025-07-27
6.4K0
DeepSeek-V4 本地部署,SGLang 把活做绝了
今天换个角度,从架构和推理引擎的视角聊聊:DeepSeek-V4 这次发布为啥这么难伺候,以及 SGLang Day-0 是怎么把活给做下来的
Ai学习的老章
2026-05-08
4.8K0
【论文复现】试试号称最好的7B模型
Mistral 7B 是一款新型大语言模型,拥有惊人的7.3万亿参数,其性能甚至超越了拥有13万亿参数的Liama2。
Eternity._
2024-11-30
7890
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券