1. 适用的模型架构
剪枝技术广泛适用于各类基于 Transformer 的大语言模型:
- Decoder-only 架构:如 LLaMA 系列、Qwen 系列、Mistral 等,是目前剪枝研究的主要对象。
- Encoder-Decoder 架构:如 T5 系列,可通过注意力头剪枝实现有效压缩。
- MoE(Mixture of Experts)架构:如 DeepSeek-MoE、Switch Transformer,可对专家网络进行选择性剪枝。
2. 不同规模模型的剪枝策略
- 小规模模型(1B–7B):对剪枝较为敏感,建议采用较低的剪枝率(20%–30%)并配合微调。
- 中等规模模型(7B–13B):可承受中等剪枝率(30%–50%),是剪枝技术应用的最佳区间。
- 大规模模型(70B+):由于参数冗余度更高,可尝试更高的剪枝率,但计算开销也更大。
3. 特定模型的剪枝实践
- LLaMA 系列:有最丰富的剪枝研究和工具支持,Wanda、SparseGPT 等方法均有成熟的实现。
- Qwen 系列:腾讯 AngelSlim 已提供 Qwen3 全系列的 Eagle3 压缩权重。
- DeepSeek 系列:已有针对 DeepSeek视觉语言模型的结构化剪枝实践,合理剪枝可减少 30% 的注意力头数量而准确率下降不超过 1.5%。