剪枝和量化是大模型压缩中最常用的两种技术,二者结合可实现叠加效应:
阶段 | 技术 | 预期效果 |
|---|---|---|
第一阶段 | 结构化剪枝(30%–50%) | 减少 40%–60% 计算量 |
第二阶段 | 知识蒸馏 | 恢复剪枝损失的 2%–5% 精度 |
第三阶段 | INT8/INT4 量化 | 额外 2–4 倍存储节省和推理加速 |
腾讯混元团队开源的 AngelSlim 框架将量化、投机解码、稀疏注意力和 Token 剪枝四条技术路线统一到一个体系中。该框架支持 Qwen3 全系列模型的 Eagle3 权重压缩,以及 DeepSeek-R1 级别的 W4A8-FP8 量化权重,为不同场景提供体系化的压缩解决方案。