GQA 通过减少键值头数来压缩缓存,而多头潜在注意力(MLA,由 DeepSeek-V2 于 2024 年提出)换了一条路径:它将键、值联合投影到一个低维潜在空间,每层每个 token 只缓存一个约 512 维的潜在向量与一个约 64 维的解耦 RoPE 键(合计约 576 个浮点数),注意力时再经上投影恢复出各头的键、值。
DeepSeek-V2 论文报告,MLA 相较其采用标准多头注意力(MHA)的前代模型 DeepSeek-67B,将 KV 缓存压缩约 93.3%(即降至原有的约 6.7%)。在 DeepSeek-V2 的 128 头配置下,MLA 每层每 token 的缓存(约 576 个浮点数)约为同等 8 组 GQA 配置(约 2048 个浮点数)的 1/3~1/4,即再小约 3~4 倍。
与 GQA 仅"减少缓存的头数"不同,MLA 进一步"压缩每个表示的维度",因此能做到比 GQA 更大幅度的缓存缩减;DeepSeek 的消融实验显示,在相同参数量下 MLA 的困惑度与下游表现可匹配甚至优于 MHA 与 GQA。这意味着在长上下文、高并发场景中,MLA 相比 GQA 提供了显著更高的 KV 缓存压缩收益。