vLLM 以 PagedAttention 为核心,维护一个 KV 缓存块分配器:统一管理空闲块池,按请求增长按需分配物理页,并通过块表记录每个请求的逻辑位置到物理页的映射;请求结束即回收其块,显存利用率接近最优。
借助块表与写时复制机制,vLLM 在共享前缀、并行采样等场景下复用同一批物理页,避免重复存储与重复计算,这也是前文所述跨请求共享的实现基础。
当显存不足时,vLLM 可将部分 KV 块换出到 CPU 内存(块交换)或选择重计算来腾出空间;同时支持 FP8 等低精度 KV 缓存量化以压缩体积。类似地,TensorRT-LLM、SGLang 等引擎也提供了各自的 KV 缓存管理方案,腾讯云 TI-ONE 内置的 TACO 推理加速引擎则在长文本、高并发场景提供 PD 分离部署与 KV 缓存相关优化。