推理延迟主要由首token延迟(TTFT)和解码延迟两部分组成。量化通过减少权重加载时间和内存访问次数来降低延迟。实测中,INT8量化可使延迟降低约40%-50%,INT4-AWQ可降低约50%-60%,具体效果取决于硬件平台和batch size。但对于小batch size场景,4-bit量化可能存在"解包开销"(unpacking tax)——需要将压缩的INT4权重反量化回FP16/BF16再计算,反而可能增加单次推理延迟。因此低延迟优先的场景更适合INT8或FP8。
吞吐量(tokens/秒)的提升主要来自两个方面:一是低精度计算本身的加速(FP8比FP16快33%),二是显存节省允许更大的batch size。在高batch size(≥16)场景下,INT4量化的吞吐量可达FP16的3-4倍。vLLM框架结合PagedAttention和连续批处理技术,在H100上使用FP8量化可实现793 tokens/秒的吞吐量,P99延迟仅80ms。
高并发云端服务推荐FP8或INT8,在H100上FP8提供最佳的精度-速度平衡;显存受限需要部署更大模型时选择INT4-AWQ,可在单张消费级GPU上运行70B模型;边缘设备和CPU推理场景选择GGUF格式(推荐Q4_K_M或Q5_K_M),在Apple Silicon上利用统一内存优势实现高效推理;追求极致吞吐的批处理任务可选择INT4-GPTQ配合Marlin内核。
行业公开基准测试数据显示,在vLLM上运行Llama-3-70B时,FP8量化的吞吐量可达FP16基线的约1.9倍,INT8约为1.6-1.7倍,INT4-AWQ可达2.3倍以上。精度方面,FP8的MMLU准确率下降通常在1个百分点以内,INT8下降约2-3个百分点,INT4下降幅度更大但在多数通用任务上仍可接受。这些数据清晰地展示了精度与性能的权衡曲线,为不同场景的选型提供了实证依据。