首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型量化 >训练后量化和量化感知训练各有什么优缺点?

训练后量化和量化感知训练各有什么优缺点?

词条归属:大模型量化

1. 训练后量化(PTQ)的工作机制

PTQ在模型训练完成后直接进行量化,只需少量校准数据(通常128-512个样本)统计各层权重和激活值的分布范围,计算量化参数后完成映射。完整流程包括:加载预训练模型→用校准数据前向传播收集统计信息→计算scale和zero-point→转换权重为低精度格式→评估精度并调整策略。GPTQ、AWQ、GGUF等均属于PTQ范畴,整个过程通常在几十分钟到几小时内完成。

2. 量化感知训练(QAT)的工作机制

QAT在训练过程中模拟量化效果,在前向传播中插入伪量化节点(fake quantization),让模型学习适应量化噪声。反向传播时使用直通估计器(STE)绕过量化操作的不可导问题。经过若干epoch的微调后,权重自然具备对量化误差的鲁棒性。Google在Gemma 3上实践表明,仅5000步QAT即可将INT4量化后的精度损失减少54%。

3. 两者核心对比

维度

PTQ

QAT

训练成本

无需训练

需微调(原训练的约1/10时间)

数据需求

少量校准数据(约512样本)

需训练数据(1万-10万样本)

INT8精度

几乎无损(~99%)

几乎无损(~99.5%)

INT4精度

轻微下降(90%-95%保持率)

更好(95%-98%保持率)

开发周期

几小时到1天

几天到1周

适用场景

快速部署、模型微调后量化

极致精度要求、极低比特量化

4. 选型决策建议

选择PTQ的场景包括:使用预训练模型且无法获取训练数据、需要快速上线(1-2天内)、INT8/INT4精度已满足业务需求、计算资源有限无法支撑QAT。选择QAT的场景包括:拥有训练数据和充足算力、需要INT2/INT3等极低比特量化、精度要求极高(如金融、医疗领域)、需要灵活的混合精度策略。实践中也可采用混合方案:对大部分层使用PTQ,对关键层(如embedding、output层)使用QAT,在精度和成本间取得平衡。

相关文章
【AI系统】感知量化训练 QAT
本文将会介绍感知量化训练(QAT)流程,这是一种在训练期间模拟量化操作的方法,用于减少将神经网络模型从 FP32 精度量化到 INT8 时的精度损失。QAT 通过在模型中插入伪量化节点(FakeQuant)来模拟量化误差,并在训练过程中最小化这些误差,最终得到一个适应量化环境的模型。
用户11307734
2024-12-05
1.9K0
基于OneFlow实现量化感知训练
这篇文章主要是讲解一下量化感知训练的原理,以及基于OneFlow实现一个Demo级别的手动量化感知训练。
BBuf
2021-08-19
1.2K0
大模型应用:高精度量化感知训练(QAT)与低成本后训练量化(PTQ)方案优选.55
在我们反复探讨的大模型落地的过程中,高性能与低成本的矛盾始终存在。想用好一个高性能拥有千亿参数大模型,都面临着存储占用高、推理速度慢的问题。模型量化作为一种核心的优化技术,通过将 32 位浮点数(FP32)转换为 8 位整数(INT8)甚至更低精度的数值,能实现模型体积压缩、推理速度提升的目标。
未闻花名
2026-03-24
1.1K2
【AI系统】训练后量化与部署
本文将会重点介绍训练后量化技术的两种方式:动态和静态方法,将模型权重和激活从浮点数转换为整数,以减少模型大小和加速推理。并以 KL 散度作为例子讲解校准方法和量化粒度控制来平衡模型精度和性能。
用户11307734
2024-12-05
1.8K0
​AdaRound:训练后量化的自适应舍入
在对神经网络进行量化时,主要方法是将每个浮点权重分配给其最接近的定点值。本文发现,这不是最佳的量化策略。本文提出了 AdaRound,一种用于训练后量化的更好的权重舍入机制,它可以适应数据和任务损失。AdaRound 速度很快,不需要对网络进行微调,仅需要少量未标记的数据。本文首先从理论上分析预训练神经网络的舍入问题。通过用泰勒级数展开来逼近任务损失,舍入任务被视为二次无约束二值优化问简化为逐层局部损失,并建议通过软松弛来优化此损失。AdaRound 不仅比舍入取整有显著的提升,而且还为几种网络和任务上的训练后量化建立了新的最新技术。无需进行微调,本文就可以将 Resnet18 和 Resnet50 的权重量化为 4 位,同时保持 1% 的精度损失。
AI异构
2021-03-09
3K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券