1. 精度变化的总体规律
适度剪枝(20%–40%)下,模型在大多数下游任务上的精度损失较小:
- 对 7B 规模模型剪掉 30% 的注意力头后,MMLU 精度下降通常小于 2%。
- 结构化剪枝 40%–50% 时,WikiText-2 困惑度会有所上升,但通过微调可有效恢复。
- 过度剪枝(超过 60%)可能导致精度急剧下降,出现所谓的"精度崩塌"现象。
2. 不同能力的差异化影响
UniComp 统一评估框架的研究发现,剪枝对不同能力的影响存在显著差异:
- 事实性知识:相对保持较好,因为这类知识主要编码在权重中。
- 多步推理能力:较为脆弱,剪枝后下降幅度较大。
- 指令遵循能力:中度敏感,适度剪枝下可保持基本水平。
- 多语言能力:下降较明显,尤其是低资源语言。
3. 意外增益现象
部分研究发现,适度的宽度剪枝在某些指标上反而带来提升:
- TruthfulQA 等真实性评估指标在剪枝后有时会改善,可能是因为剪枝减少了模型记忆的错误知识。
- IFEval(指令遵循评估)在 30% 剪枝率下可能出现非单调的性能提升。