首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >KV 缓存机制 >自回归生成中的 Prefill 阶段和 Decode 阶段分别如何与 KV 缓存配合?

自回归生成中的 Prefill 阶段和 Decode 阶段分别如何与 KV 缓存配合?

词条归属:KV 缓存机制

1. Prefill 阶段一次性填充缓存

在预填充(Prefill)阶段,模型并行处理用户输入的完整提示词,为其中每一个 token 计算键、值投影,并将全部结果按层写入 KV 缓存。该阶段完成之后,缓存中已经包含了整段提示词的注意力状态,供后续生成直接复用。

2. Decode 阶段逐 token 追加与查询

在解码(Decode)阶段,模型一次只生成一个新 token。每步先计算新 token 的查询、键、值,将键、值追加进缓存,再让新查询与缓存中全部历史键、值做注意力运算得到输出。生成结束后该步的键、值留在缓存中,供下一步继续使用。

3. 两阶段协作构成完整推理循环

Prefill 负责"批量建缓存",Decode 负责"增量用缓存",二者共享同一套缓存结构。正是这种分工,使得提示词越长,Prefill 越重,而 Decode 每步保持轻量,整体推理效率得以保证。

相关文章
大模型推理-基于prefill和decode阶段特性,PD分离,势在必行!
大模型推理过程,可以分为两个阶段,预填充阶段(prefill stage)和解码阶段(decode stage)。预填充阶段是计算密集型,解码阶段为内存密集型,两个阶段分别具有不同的推理特性。如果把两个阶段放在同一个计算设备上,会导致两阶段优化目标SLOs冲突,而且耦合了两个阶段的部署策略。将两个阶段分别部署到不同的设备上,使用PD分离架构推理,各自优化,势在必行!
AI老马
2026-01-13
3.2K0
揭秘AI智算中心网络流量之AI推理
本篇为“揭秘AI智算中心网络流量“系列的第二篇,前篇请参阅:一文揭秘AI智算中心网络流量 – 大模型训练篇 。有关数据存储流量的分析将于下篇呈现,敬请关注。
星融元Asterfusion
2024-07-26
1.5K0
打破算力瓶颈:LLM推理中Prefill/Decode分离架构深度解析
在LLM推理计算中Prefill和Decode两个阶段的计算/显存/带宽需求不一样,通常Prefill是算力密集,Decode是访存密集。一些场景中P和D两者分开计算可提升性能。vLLM是一种主流的推理框架,今天我将主要围绕其PD分离场景做讨论,欢迎交流指正!👍
AI课代表
2025-09-09
4.9K0
为什么同一批模型,有的秒回有的卡成PPT?20篇论文万字深扒大模型推理的隐藏瓶颈
大语言模型(LLM)推理服务正从“模型精度的竞赛”转向“系统效率的比拼”。当模型能力趋同,推理延迟与吞吐量的优化成为大模型规模化落地的关键瓶颈。然而,传统负载均衡算法在设计之初并未预见LLM推理负载的三大根本特征:
乐小野
2026-06-01
6470
KV Cache管理架构演进:从连续分配到统一混合内存架构
在生产环境部署过LLM的人都知道模型权重只是问题的一半,另一半是KV cache:存储注意力状态的运行时内存,让模型在生成token时不必从头开始重算。能不能管好这块内存决定了系统是一个卡顿的demo还是一个可用的推理服务。
deephub
2026-03-04
1.5K1
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券