作为训练和高精度推理的基准精度,FP16每参数占用2字节,Llama-70B模型需约140GB显存。BF16(Bfloat16)保留了与FP32相同的指数位(8位),动态范围与FP32一致,适合大规模分布式训练避免梯度溢出。这两种精度通常作为量化效果的对比基线,在生产环境中较少直接部署。
FP8有E4M3和E5M2两种主流格式:E4M3具有4位指数和3位尾数,精度较高适合前向推理;E5M2具有5位指数和2位尾数,动态范围更大适合KV缓存。FP8相比FP16可减少50%显存占用,推理速度提升30%-33%,困惑度增加仅0.1-0.3%,被广泛视为2026年H100及以上硬件的生产环境默认选择。
INT8提供约2倍显存压缩,精度损失通常小于1%,大多数GPU/TPU/NPU均支持INT8 Tensor Core加速。其优势在于跨平台兼容性最佳,在A100、AMD MI300X等不支持原生FP8的硬件上是首选方案。SmoothQuant等技术使INT8实现了权重和激活同时8位量化(W8A8),在OPT-66B等模型上精度损失仅0.6%。
INT4提供约4倍显存压缩(相比FP16减少75%),配合AWQ或GPTQ等先进算法可将精度损失控制在1.5-2个百分点以内。Llama-70B以INT4量化后仅需约35GB显存,可在双张RTX 4090(共48GB)或单张RTX 6000 Ada(48GB)上部署。吞吐量相比FP16可提升2.6-3.1倍,是显存受限场景的主流选择。
INT3、INT2乃至1.58-bit(如BitNet b1.58使用三值{-1, 0, +1})属于研究级方案。当比特数降至3以下时,精度下降呈非线性增长,在MMLU-Pro等基准上可能退化4-12个百分点,对代码生成、数学推理等高要求任务影响尤为显著。这类方案目前主要适用于极端资源受限的边缘场景或学术研究。