最直观的方法是使用权重的绝对值作为重要性分数:
importance(w_i) = |w_i|该方法计算效率极高,但对于大模型而言,单纯依赖幅值往往导致严重的精度下降。
利用损失函数对权重的梯度来评估重要性:
importance(w_i) = |∂L/∂w_i × w_i|这种方法考虑了权重对最终损失的敏感度,比纯幅值方法更准确。LLM-Pruner 等框架采用梯度评分来识别需要保留的关键结构。
通过二阶梯度信息评估权重的重要性,理论上最为精确:
importance(w_i) = H_ii × w_i²其中 H_ii 是 Hessian 矩阵的对角元素。SparseGPT 利用这种二阶信息进行逐层重构,在高稀疏度下仍能保持较好精度,但计算复杂度较高。
Wanda 方法提出了一种无需训练的评分机制,将权重幅值与输入激活的范数相结合:
importance(w_ij) = |w_ij| × ||x_j||₂其中 x_j 是对应输入通道的激活向量。该方法仅需少量校准数据即可完成评分,在多个基准测试中表现优异。
最新研究如 HyWIA(Hybrid-grained Weight Importance Assessment)融合了细粒度和粗粒度的重要性评估,通过注意力机制自适应地确定最优的粒度组合,在 LLaMA-7B 50% 剪枝率下比 LLM-Pruner 平均精度提升 2.82%。