1. 理论关系
压缩率与推理速度的提升并非线性关系,而是受到多种因素制约:
- FLOPs 减少比例:结构化剪枝直接减少矩阵乘法运算量,FLOPs 的减少大致与剪枝率成正比。
- 内存带宽优化:减少参数量降低了权重加载的内存带宽需求,对小批量推理尤为明显。
- 硬件利用率:剪枝后的矩阵尺寸需要与硬件的计算单元对齐才能获得最佳加速效果。
2. 实测数据参考
根据多项研究的实测结果:
- 对 7B 模型进行 30% 结构化剪枝后,推理速度提升约 25%,MMLU 精度下降小于 2%。
- 在某边缘设备部署场景中,通过结构化剪枝将模型从 1.2B 参数压缩至 380M,FLOPs 减少 62%,推理延迟从 120ms 降至 45ms。
- 在智能客服系统中,对 BERT 模型进行 40% 结构化剪枝后再进行 INT8 量化,推理延迟从 230ms 降至 68ms。
3. 边际效应递减
随着剪枝率的提高,单位剪枝率带来的速度增益逐渐减小,而精度损失则加速增大。因此在实际应用中需要找到压缩率与精度的帕累托最优点。