首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >多头潜在注意力(MLA)相比 GQA 在 KV 缓存压缩上有多大提升?

多头潜在注意力(MLA)相比 GQA 在 KV 缓存压缩上有多大提升?

词条归属:KV 缓存机制

1. MLA 以低秩压缩替代头共享

GQA 通过减少键值头数来压缩缓存,而多头潜在注意力(MLA,由 DeepSeek-V2 于 2024 年提出)换了一条路径:它将键、值联合投影到一个低维潜在空间,每层每个 token 只缓存一个约 512 维的潜在向量与一个约 64 维的解耦 RoPE 键(合计约 576 个浮点数),注意力时再经上投影恢复出各头的键、值。

2. 相对 GQA 前辈的显著压缩比

DeepSeek-V2 论文报告,MLA 相较其采用标准多头注意力(MHA)的前代模型 DeepSeek-67B,将 KV 缓存压缩约 93.3%(即降至原有的约 6.7%)。在 DeepSeek-V2 的 128 头配置下,MLA 每层每 token 的缓存(约 576 个浮点数)约为同等 8 组 GQA 配置(约 2048 个浮点数)的 1/3~1/4,即再小约 3~4 倍。

3. 压缩更激进且质量不降反优

与 GQA 仅"减少缓存的头数"不同,MLA 进一步"压缩每个表示的维度",因此能做到比 GQA 更大幅度的缓存缩减;DeepSeek 的消融实验显示,在相同参数量下 MLA 的困惑度与下游表现可匹配甚至优于 MHA 与 GQA。这意味着在长上下文、高并发场景中,MLA 相比 GQA 提供了显著更高的 KV 缓存压缩收益。

相关文章
深度学习之MHA|MQA|GQA|MLA注意力机制对比分析
最初的注意力机制是在Seq2Seq模型中,注意力机制被引入,用于在解码时关注编码器的隐藏状态。这是单向的,通常只有一个头,也就是单头注意力机制。
阳光宅猿
2026-03-05
2K0
DeepSeek技术架构解析:MLA多头潜在注意力
MLA主要通过优化KV-cache来减少显存占用,从而提升推理性能。我们知道这个结论之前,老周带大家一起梳理一下从MHA、MQA、GQA到MLA的演变历程,并着重介绍一下MLA的设计思路。
老周聊架构
2025-11-20
2.1K0
腾讯混元 & 东京工业大学 无损 KV 缓存压缩至2% ,护航大型语言模型推理!
大型语言模型(LLMs)已在各个领域广泛应用并得到验证,改变了作者收集和处理信息的方式,并影响了作者的日常生活。Driess等人(2023年);Zhang等人;Zhu等人;Wang等人(2024年)。最近,LLM的长文本推理和理解能力逐渐被认为对其能力至关重要,引起了越来越多的关注。开源和闭源LLM现在都在努力适应更长的 Token 长度,Achiam等人(2023年);DeepSeek-AI(2024年)。然而,这种长度扩展对LLM提出了关键的效率挑战,特别是与日益增长的键值(KV)缓存内存问题,这给更强大的LLM的部署带来了巨大的障碍。KV缓存技术,涉及从解码器仅有的Transformer多头自注意力(MHA)块(Vaswani等人,2017年)中缓存和重用已计算的键值向量,在大多数解码器仅有的LLM中广泛采用,以加速模型推理速度。
未来先知
2024-12-27
1.3K0
DeepSeek的MLA,任意大模型都能轻松迁移了
DeepSeek-R1 作为 AI 产业颠覆式创新的代表轰动了业界,特别是其训练与推理成本仅为同等性能大模型的数十分之一。多头潜在注意力网络(Multi-head Latent Attention, MLA)是其经济推理架构的核心之一,通过对键值缓存进行低秩压缩,显著降低推理成本 [1]。
机器之心
2025-03-07
8730
DeepSeek-V3多头潜在注意力(MLA)架构
在本系列的第一部分中,通过探索DeepSeek-V3的理论基础并实现关键配置元素(如旋转位置嵌入RoPE),奠定了坚实基础。该教程阐述了DeepSeek-V3如何管理长距离依赖并为其高效扩展设置架构。
用户11764306
2026-04-18
7810
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券