在解码阶段,每个新 token 都需要把完整模型权重与不断增长的 KV 缓存从显存读入计算单元。由于每读入一批数据对应的实际浮点运算很少,GPU 的计算单元往往处于等待数据的空闲状态,瓶颈落在内存带宽而非算力上。
在批大小较小时,推理的计算强度低,主要受限于显存容量与带宽;只有当批大小足够大、计算强度提升后,算力才逐渐主导。KV 缓存在长上下文下随序列线性膨胀,使显存约束在多数实际场景中先于算力成为限制因素。
短上下文时模型权重是显存主体;上下文变长后,KV 缓存会快速逼近甚至超过权重占用,二者叠加使得单卡能承载的并发数与最大上下文直接受显存上限约束,而非受 GPU 算力约束。