GPTQ(ICLR 2023)基于二阶信息(Hessian矩阵近似)确定量化每个权重时的最优补偿策略。通过逐层量化并将量化误差"传播"到后续权重中,可在数小时内将OPT-175B和BLOOM-176B压缩到3-4 bit且精度几乎不受影响。GPTQ建立了LLM量化的工程基准,后续方法多以之为比较对象。配合Marlin CUDA内核优化后,GPTQ推理速度可比基础版本提升2.5倍。
AWQ(MLSys 2024最佳论文)的核心发现是:只需保护1%的关键权重即可实现近乎无损的4-bit量化。它根据激活值大小识别重要权重,通过缩放因子对其进行保护后再量化。与GPTQ的逐层二阶优化不同,AWQ更直觉、更快速且硬件友好。在多数评测中AWQ的精度一致性优于GPTQ,是当前GPU生产服务的首选4-bit方案。
SmoothQuant通过数学等价变换将激活的量化难度迁移到权重端,实现了无需训练的W8A8(8位权重+8位激活)全量化。在OPT-66B上精度损失仅0.6%,推理加速1.56倍,显存减半。该方法已在TensorRT-LLM和vLLM中原生集成,成为生产级INT8部署的标准技术路径。
FP8代表了低精度推理的最新方向,利用NVIDIA Hopper和Blackwell架构的硬件原生支持,在几乎无精度损失的前提下实现显著加速。DeepSeek V3/R1和Kimi-K2等主流开源大模型已原生支持FP8精度训练和推理。随着H100/B100部署规模扩大,FP8正成为云端推理的默认精度设置,边缘侧则由INT4/INT8继续主导。
复域量化通过将参数表示从实数域扩展至复数域,引入幅度和相位两个自由度,在极低比特条件下突破了实数域量化的性能天花板。BitNet b1.58挑战了"模型必须是浮点数"的基本假设,使用三值{-1, 0, +1}权重在3B规模上匹配FP16 LLaMA的表现。MXFP4(指数细粒度FP4)由OpenAI的GPT-OSS系列率先在MoE层采用,预示着未来更多模型将原生支持4-bit精度。这些前沿方向共同指向一个趋势:量化正在从"后处理压缩"演变为"原生低精度建模"。