模型权重显存与参数量和精度位数成正比:Weight Size (GB) ≈ Parameter Count (B) × Bits / 8。70B模型在FP16下约140GB,FP8/INT8下约70GB,INT4下约35GB。这种线性压缩关系使得量化成为降低显存需求最直接的手段。对于MoE模型如DeepSeek-V3,虽然每次推理仅激活部分专家参数,但全部权重仍需驻留显存,量化带来的显存节省同样显著。
在长上下文场景中,KV Cache的显存占用可能超过模型权重本身。以Llama-70B在1M token上下文为例,FP16的KV Cache高达约135GB,超过140GB的权重显存。将KV Cache量化为FP8可直接减半至约67.5GB,配合GQA(分组查询注意力)或DeepSeek的MLA(多头潜在注意力)机制,可进一步将KV Cache压缩7-14倍。多重优化叠加后,1M上下文的KV Cache可从135GB降至8GB,降幅达94%。
显存节省直接转化为更高的并发承载能力。实测数据显示,在H100单卡80GB显存限制下,将Llama-3-8B的KV Cache从BF16改为FP8后,峰值并发请求数从170提升至1,033,实现了5倍以上的容量增长。对于70B模型,INT4量化使显存从140GB降至35GB,释放出的显存空间可用于更大的batch size或更长的上下文窗口,显著提升服务吞吐能力。
生产环境中常采用混合精度策略进一步优化显存:权重使用INT4存储,计算时按需反量化;KV Cache使用FP8;关键的embedding和lm_head层保持FP16。腾讯云TI-ONE平台的angel-vllm推理镜像即支持在线INT8/NF4/FP8的weight-only量化和LayerwiseSearchSMQ等多种量化加速方式,可根据具体模型和硬件条件灵活选择最优配置。