首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >分组查询注意力(GQA)如何缩减 KV 缓存体积?

分组查询注意力(GQA)如何缩减 KV 缓存体积?

词条归属:KV 缓存机制

1. 用分组共享减少键值头数

标准多头注意力(MHA)中,每个查询头都拥有独立的键、值头,缓存的键值头数与查询头数相同。分组查询注意力(GQA,由 Ainslie 等人于 2023 年提出)让多个查询头组成一组、共享同一组键、值头,从而显著减少需要缓存的键值头数量。

2. 压缩倍数等于分组数

若查询头数为 H、每组包含 g 个查询头,则键值头数降为 H/g,KV 缓存体积相应缩减约 g 倍。以 LLaMA-2 70B 为例,其采用 8 组 GQA(64 个查询头共享为 8 个键值头),相较 MHA 将 KV 缓存缩小约 8 倍,而模型质量损失极小(标准基准上约为 0.2 个百分点)。

3. 成为主流模型的默认选择

由于 GQA 在缓存体积与表达能力之间取得良好平衡,Llama-3 系列等大量生产级模型已普遍采用 GQA 作为默认注意力架构,从源头降低 KV 缓存的显存压力。

相关文章
深度学习之MHA|MQA|GQA|MLA注意力机制对比分析
最初的注意力机制是在Seq2Seq模型中,注意力机制被引入,用于在解码时关注编码器的隐藏状态。这是单向的,通常只有一个头,也就是单头注意力机制。
阳光宅猿
2026-03-05
2K0
缓存技术:从CPU Cache到AI KV Cache (五)KV Cache
它的核心作用是:通过缓存历史Token 在每一层 Transformer 中计算得到的 Key 和 Value,避免 Decode 阶段重复计算历史 Token 的 Attention,从而显著降低 LLM 推理延迟。
霞姐聊IT
2026-06-24
6040
DeepSeek-V3多头潜在注意力(MLA)架构
在本系列的第一部分中,通过探索DeepSeek-V3的理论基础并实现关键配置元素(如旋转位置嵌入RoPE),奠定了坚实基础。该教程阐述了DeepSeek-V3如何管理长距离依赖并为其高效扩展设置架构。
用户11764306
2026-04-18
7810
DeepSeek技术架构解析:MLA多头潜在注意力
MLA主要通过优化KV-cache来减少显存占用,从而提升推理性能。我们知道这个结论之前,老周带大家一起梳理一下从MHA、MQA、GQA到MLA的演变历程,并着重介绍一下MLA的设计思路。
老周聊架构
2025-11-20
2.1K0
大模型上下文成本与注意力优化技术深度解析——为何O(n²)平方复杂度无法被常规优化消除
在大模型落地、推理成本优化、长上下文模型选型的工程实践中,一直流传一句经典结论:大模型 Token 成本随上下文长度呈 O(n²) 平方上涨,128K 上下文相比 8K 上下文成本会暴涨几十倍。
微学AI
2026-08-13
1720
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券