首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >PagedAttention 通过什么机制实现不同请求间的 KV 缓存共享?

PagedAttention 通过什么机制实现不同请求间的 KV 缓存共享?

词条归属:KV 缓存机制

1. 以分页方式映射逻辑与物理位置

PagedAttention(由 vLLM 在 2023 年提出)借鉴操作系统的虚拟内存分页思想,将 KV 缓存切分为固定大小的块(页),并通过块表(Block Table)把请求的逻辑 token 位置映射到物理显存页。物理页可按需分配,不必连续。

2. 写时复制实现前缀复用

当多个请求拥有相同的前缀(如同一系统提示词)时,它们可以指向同一批物理页,仅在某个请求发生分歧、需要写入新内容时才复制出独立副本(写时复制,Copy-on-Write)。这样相同前缀的 KV 缓存只需计算与存储一次,便被多个请求共享。

3. 共享带来的吞吐收益

通过写时复制的页共享,并行采样、束搜索以及共享前缀的批量请求都能复用已有缓存,既减少重复计算,又提升显存利用率与并发吞吐,是不同请求间 KV 缓存共享的核心机制。

相关文章
vLLM 核心技术 PagedAttention 原理详解
本文是 vLLM 系列文章的第二篇,介绍 vLLM 核心技术 PagedAttention 的设计理念与实现机制。
Se7en258
2025-06-09
4.2K0
6.7k Star量的vLLM出论文了,让每个人都能轻松快速低成本地部署LLM服务
今年六月,来自加州大学伯克利分校等机构的一个研究团队开源了 vLLM(目前已有 6700 多个 star),其使用了一种新设计的注意力算法 PagedAttention,可让服务提供商轻松、快速且低成本地发布 LLM 服务。
机器之心
2023-09-25
2.7K0
解锁 vLLM:大语言模型推理的速度与效率双提升
当我们进行微批处理(mini-batch)时,虽然能减少计算浪费并以更灵活的方式批处理请求,但由于GPU内存容量的限制(特别是存储 KV 缓存的空间),仍然限制了可以一起批处理的请求数量,这意味着服务系统的吞吐量受到内存的限制。具体的内存管理挑战有如下三个方面:
唐国梁Tommy
2023-10-25
7.9K0
LLM吞吐量提高2-4倍,模型越大效果越好!UC伯克利、斯坦福等开源高效内存管理机制PagedAttention
虽然大型语言模型(LLM)的性能表现足够惊艳,但每次接收用户请求时都需要耗费大量显存和计算资源,一旦请求数量超出预期,就极有可能面临ChatGPT刚发布时的宕机、排队、高延迟等窘境。
新智元
2023-09-27
1.8K0
解剖vLLM:高吞吐LLM推理引擎的7大核心技术​
作为分布式大模型推理引擎,vLLM通过分页注意力、连续批处理等核心技术实现高吞吐与低延迟。今天我将深度解析其架构设计。如果对你有所帮助,记得告诉身边有需要的朋友。
AI课代表
2025-09-04
2.2K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券