首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型剪枝 >大模型剪枝后为什么需要进行微调?

大模型剪枝后为什么需要进行微调?

词条归属:大模型剪枝

1. 补偿精度损失

剪枝移除了部分参数,破坏了原有的权重分布。微调通过在少量校准数据上继续训练,让剩余权重重新适应新的网络结构,从而恢复被剪枝破坏的表征能力。

2. 微调的关键技巧

  • 学习率调整:剪枝后的微调通常需要将学习率降低至原始训练时的 1/3 左右,以避免破坏已学到的特征。
  • 正则化策略:增加 L2 正则化防止过拟合,因为剪枝后的模型容量减小,更容易过拟合微调数据。
  • 数据增强:使用更强的数据增强策略弥补因剪枝造成的信息损失。
  • 蒸馏辅助:在微调过程中引入知识蒸馏损失,让剪枝后的模型继续模仿原始模型的输出分布。

3. 微调的数据需求

微调所需的数据量远少于原始训练:

  • 对于训练后剪枝,通常只需 128–512 条校准样本即可完成有效微调。
  • 对于迭代式剪枝,每轮微调可使用更少的数据(如 64–128 条),但需要更多轮次。
相关文章
学习笔记:什么是大模型微调
大模型微调(Fine-tuning)是一种在预训练模型(Pre-trained Language Models, PLMs)完成训练后,为了适应特定任务或用户需求而对其进行优化和调整的技术和方法。
用户4230668
2026-07-17
1100
AI最佳应用篇——什么时候需要微调你的大模型(LLM)?
在AI盛起的当下,各类AI应用不断地出现在人们的视野中,AI正在重塑着各行各业。相信现在各大公司都在进行着不同程度的AI布局,有AI大模型自研能力的公司毕竟是少数,对于大部分公司来说,在一款开源可商用的大模型基础上进行行业数据微调也正在成为一种不错的选择。
山行AI
2023-06-26
1.8K0
怎么让英文大语言模型支持中文?(三)进行指令微调
这里是最后一部分了:怎么让英文大语言模型支持中文?(三)对预训练模型进行指令微调。
西西嘛呦
2023-07-10
1.5K0
大模型相关技术-为什么需要rerank
在RAG(RetrievalAugmented Generation)中,embedding模型的向量检索可以帮助提高文本生成的效果,但仍然需要
西门呀在吹雪
2024-05-07
2.8K0
使用LLaMA-Factory对LLM大模型进行微调!训练专属于你的模型!
如今也是出现了各种各样的大模型,如果想要针对性的让他扮演某个角色我们通常采用的是给他输入prompt(提示词)。
MGS浪疯
2024-11-22
4.4K3
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券