1. 冗余性假设
神经网络中存在大量冗余参数,研究表明大模型中约 30%–50% 的参数对最终输出的贡献极小。剪枝技术基于这一观察,通过系统性地识别并移除这些"不重要"的权重或结构单元来实现模型压缩。
2. 重要性评分机制
剪枝的核心在于如何衡量每个参数或结构单元的重要性。常见的评分标准包括:
- 幅值评分(Magnitude-based):以权重的绝对值大小作为重要性指标,绝对值越小的权重被认为越不重要。这是最基础也最高效的评分方法。
- 梯度评分(Gradient-based):利用损失函数对权重的梯度信息评估重要性,能够反映权重变化对最终损失的影响程度。
- Hessian 评分:基于二阶梯度信息(Hessian 矩阵)评估权重的重要性,精度更高但计算开销较大,代表方法如 SparseGPT。
- 激活感知评分:结合权重幅值与对应输入激活值进行综合评分,代表方法 Wanda(Weights and Activations)无需重新训练即可实现有效剪枝。
3. 剪枝后补偿
移除参数后,剩余权重需要进行调整以补偿精度损失。常见策略包括一次性权重更新(如 OBS 方法)、迭代式微调以及知识蒸馏辅助恢复等。