自注意力计算中,第 t 个 token 的输出仅依赖于当前 token 的查询(Query)与所有历史 token 的键、值。已生成 token 的键、值一旦算出,就不再随后续 token 的生成而改变——这一"历史表示与未来无关"的数学特性,使得缓存下来的键、值可以被任意后续步安全复用,无需重新计算。
键、值由输入表示经固定的线性投影(乘以权重矩阵 W_K、W_V)得到,是确定性的函数输出。只要输入 token 不变,其键、值就唯一确定,因此缓存具有完全一致的正确性保障,不会因为复用而产生近似误差。
在因果语言建模的注意力中,当前 token 只能关注其自身及之前的 token(因果掩码)。由于查询方向始终是"当前指向历史",历史键、值天然构成可被持续追加与复用的缓存,这正是 KV 缓存在解码阶段成立的数学前提。