大模型剪枝有哪些主流的开源工具和框架?
修改于 2026-07-27 17:55:05
141. 通用剪枝工具
- Wanda:基于权重和激活评分的训练后剪枝方法,实现简单且效果好,支持非结构化和半结构化(2:4)剪枝。
- SparseGPT:利用二阶梯度信息进行逐层重构的高精度剪枝方法,适合高稀疏度场景。
- LLM-Pruner:基于梯度信息的结构化剪枝框架,专注于移除关键耦合结构如注意力头和 MLP 通道。
- Torch-Pruning:PyTorch 生态中的结构化剪枝库,支持多种 LLM 架构的自动剪枝。
2. 统一剪枝框架
- LLM-Pruning Collection:普林斯顿大学 Zlab 开发的基于 JAX 的统一剪枝框架,集成了 Minitron、ShortGPT、Wanda、SparseGPT、Sheared Llama、LLM-Pruner 等多种主流方法,提供了 GPU(FMS-FSDP)和 TPU(MaxText)的训练支持。
- NVIDIA NeMo:NVIDIA 官方实现的 Minitron 方法,提供结构化剪枝加知识蒸馏的完整管线。
- Pruna AI:Apache-2.0 授权,支持数十种压缩算法,涵盖缓存、量化、剪枝、蒸馏和编译等技术类别,一行代码即可对扩散模型和大语言模型进行压缩。
3. 腾讯相关工具
- AngelSlim:腾讯混元开源的大模型压缩神器,统一整合了量化、投机解码、稀疏注意力和 Token 剪枝四条技术路线,已开源 Qwen3 全系列和 DeepSeek-R1 的压缩权重。
- 腾讯云 TI 平台:提供自动化模型压缩工具,支持一键完成量化、剪枝和蒸馏流程,配合 TI-ACC 加速推理引擎实现端到端的模型压缩与部署。