1. 补偿精度损失
剪枝移除了部分参数,破坏了原有的权重分布。微调通过在少量校准数据上继续训练,让剩余权重重新适应新的网络结构,从而恢复被剪枝破坏的表征能力。
2. 微调的关键技巧
- 学习率调整:剪枝后的微调通常需要将学习率降低至原始训练时的 1/3 左右,以避免破坏已学到的特征。
- 正则化策略:增加 L2 正则化防止过拟合,因为剪枝后的模型容量减小,更容易过拟合微调数据。
- 数据增强:使用更强的数据增强策略弥补因剪枝造成的信息损失。
- 蒸馏辅助:在微调过程中引入知识蒸馏损失,让剪枝后的模型继续模仿原始模型的输出分布。
3. 微调的数据需求
微调所需的数据量远少于原始训练:
- 对于训练后剪枝,通常只需 128–512 条校准样本即可完成有效微调。
- 对于迭代式剪枝,每轮微调可使用更少的数据(如 64–128 条),但需要更多轮次。