上下文从数 K 延伸到 128K 乃至更长时,KV 缓存体积近似线性增长,单个请求的缓存即可达到数十 GB 级别,迅速逼近甚至超过模型权重占用,使单卡可服务的并发数大幅下降。
更长的缓存意味着解码每步需从显存读取更多字节,内存带宽成为更突出的限制,长上下文下的吐字速度往往会明显低于短上下文,需要在架构与引擎层面做针对性优化。
为应对长上下文,工业界发展出缓存驱逐(如 H2O、SnapKV 保留重要 token、淘汰次要 token)、缓存量化(如 KVQuant、KIVI 以低位宽存储)、低秩压缩(MLA)与滑动窗口(SWA)等一整套技术,但激进的淘汰或量化可能在长程依赖任务上带来质量下降,需在效率与效果间权衡。