PagedAttention(由 vLLM 在 2023 年提出)借鉴操作系统的虚拟内存分页思想,将 KV 缓存切分为固定大小的块(页),并通过块表(Block Table)把请求的逻辑 token 位置映射到物理显存页。物理页可按需分配,不必连续。
当多个请求拥有相同的前缀(如同一系统提示词)时,它们可以指向同一批物理页,仅在某个请求发生分歧、需要写入新内容时才复制出独立副本(写时复制,Copy-on-Write)。这样相同前缀的 KV 缓存只需计算与存储一次,便被多个请求共享。
通过写时复制的页共享,并行采样、束搜索以及共享前缀的批量请求都能复用已有缓存,既减少重复计算,又提升显存利用率与并发吞吐,是不同请求间 KV 缓存共享的核心机制。