在每个 Transformer 注意力层中,推理引擎为该层维护两组张量:键缓存与值缓存。它们随 token 的生成在序列长度维度上不断追加,常驻于 GPU 显存(HBM)中,是 KV 缓存在物理上的主要载体。
缓存通常组织为四维张量,形状近似为(批大小, 键值头数, 序列长度, 头维度),不同框架在维度排布上略有差异(例如序列长度与头维度的顺序可能互换)。序列长度维度随生成推进而增长,是显存占用随上下文变长的直接来源。
KV 缓存与模型权重、激活值分开管理:权重在推理期间基本不变,而 KV 缓存随每个请求的生命周期动态分配与释放。正因它是动态、随请求增长的数据,才需要专门的内存管理机制来控制碎片与容量。