量化直接减少了每个参数占用的存储空间。以70B参数模型为例,FP16精度下需约140GB显存,INT8降至70GB,INT4进一步降至35GB。这意味着原本需要多张A100 80GB才能运行的模型,量化后可在单卡或少卡上部署,硬件采购成本成倍下降。KV Cache量化为FP8后还能额外节省50%的缓存显存,进一步提升并发能力。
低精度计算可利用硬件的专用加速单元。INT8 Tensor Core的理论算力是FP32的8倍,FP8在H100上的矩阵乘法算力可达FP16的2倍以上。实测中,INT8量化可实现1.5-2倍推理加速,INT4-AWQ配合Marlin内核可实现3倍以上加速。吞吐量的提升意味着相同硬件可服务更多用户,单位Token的处理成本相应下降。
大模型推理通常是memory-bound(受限于内存带宽)而非compute-bound。量化减少了数据传输量,INT4相比FP16减少了75%的权重读取带宽需求。这对于自回归生成的逐token推理尤为重要——每次生成只需从HBM读取一次权重,量化后带宽消耗成比例降低,直接转化为更低的延迟和更高的能效比。
量化使大模型能够在资源受限的边缘设备上运行。手机端可部署30亿参数规模的模型,车载芯片可支持百亿参数模型的本地推理,XR眼镜等设备也能承载轻量级大模型。端侧部署不仅节省了云端推理的持续成本,还提供了零网络延迟、数据隐私保护等附加价值。Arm等芯片厂商已将4-bit量化适配纳入其KleidiAI软件库,推动端侧AI成为行业标准。