FP16采用IEEE 754标准的16位浮点格式(1位符号+5位指数+10位尾数),能够表示较大范围的实数但存在精度冗余;INT8采用8位有符号整数格式(范围-127至127),通过线性映射近似原始浮点分布。从信息论角度看,神经网络权重超过95%落在均值±3倍标准差范围内,这为整数量化提供了理论基础。
实测数据显示,对Llama-3-70B进行INT8量化后,MMLU准确率仅下降0.4%(从79.2%降至78.8%),显存从140GB减半至74GB,吞吐量提升1.8倍,延迟降低约45%。相比之下,FP8量化的精度损失更小(约0.3-0.5个百分点),但在不支持FP8的硬件上无法发挥优势。INT8在精度损失和性能提升之间提供了更均衡的选择。
INT8得到最广泛的硬件支持,包括NVIDIA Tensor Core(Volta架构起)、Intel VNNI指令集、AMD MI系列以及各类NPU/DSP。FP8仅在NVIDIA Hopper(H100/H200)及更新的Blackwell架构上获得原生Tensor Core支持。对于跨平台部署或存量硬件较多的企业,INT8仍是更稳妥的选择。
FP16适用于对精度极度敏感的任务(如医疗诊断、法律分析、科学计算)以及长上下文(超过128K tokens)场景;INT8适用于绝大多数生产环境的通用推理任务,如客服对话机器人、代码生成工具等,在保持接近FP16精度的同时实现显著的降本增效。