量化精度损失与比特位数呈非线性关系。在4-bit以上通常较为安全,INT8量化在多数任务上精度损失小于1%,INT4量化损失约1.5-2.5个百分点。当比特数降至3-bit以下时,精度下降幅度急剧增大,在复杂推理任务上可能出现4-12个百分点的退化。跨模型测试显示,FP8在MMLU-Pro上的平均退化仅0.4个百分点,处于基准测试的噪声范围内。
通用对话和文本生成对量化相对鲁棒,而代码生成、数学推理、长上下文检索等高精度要求任务对量化更为敏感。AWQ-4在这些挑战性任务上的退化约为1.4-1.8个百分点,GPTQ-4的退化略大(1.5-2.4个百分点)且在不同模型间方差更大。生产环境中建议在目标业务场景上构建专属评测集进行A/B测试,而非仅依赖公开基准分数做决策。
大型Transformer架构中存在少量"异常值特征"(outlier features),某些维度的激活值比其他维度大100倍以上。如果直接对这些激活值进行均匀量化,会导致量化范围被异常值拉大,正常值的量化精度严重下降甚至完全失效。LLM.int8()、SmoothQuant等方法专门针对这一问题设计,通过混合精度分解或难度迁移策略有效缓解了精度崩塌风险。
对于INT4及以下量化出现的精度损失,可采用多种恢复手段:保留关键层(如embedding层、语言模型头)在FP16精度;使用AWQ等激活感知方法保护1%的关键权重;通过少量校准数据优化量化参数;或在量化后进行轻量微调(mini-QAT)。这些策略的组合使用可将INT4量化的精度损失控制在可接受范围内。