首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型量化

大模型量化

修改于 2026-07-31 16:24:57
78
概述

大模型量化(Large Model Quantization)是通过降低模型权重和激活值的数值精度,在尽量保持模型能力的前提下显著减少显存占用和计算开销的核心压缩技术。它将FP16/BF16精度的参数映射到INT8/INT4等低比特整数空间,可将模型显存压缩至原先的1/2至1/4,同时利用硬件加速实现推理速度提升。在大模型参数规模持续增长的背景下,量化已成为连接模型能力与工程落地的关键桥梁,广泛应用于云端高并发推理和边缘设备部署等场景。

一、大模型量化的基本原理是什么?

1. 数值精度映射

量化的数学本质是将连续的高精度浮点数值映射到有限的离散整数空间,通常使用仿射变换实现:Q(x) = clamp(round(x/s + z), q_min, q_max)。其中x为原始浮点数,s为缩放因子(scale),z为零点(zero-point),q_min和q_max为整数表示范围。反量化过程为D(Q(x)) = (Q(x) - z) × s,在推理时将低精度值还原参与计算。

2. 对称与非对称量化

对称量化的零点固定为0,计算效率高但对非对称分布的数据敏感;非对称量化的零点可调整,能更精确匹配数据分布但需要额外的零点存储和计算开销。实际应用中,权重量化多采用对称方式,激活量化则根据数据分布特性选择。

3. 量化粒度

量化粒度决定了scale和zero-point的共享范围,直接影响精度和计算效率。Per-Tensor量化整个张量共享一组参数,计算简单但精度较低;Per-Channel量化每个输出通道独立计算参数,精度更高适合权重量化;Per-Group量化将通道划分为多个组(典型group size为64或128),每组独立量化,在精度和效率间取得平衡,是AWQ、GPTQ等先进算法的基础。

4. 浮点与定点表示

深度学习中的数值表示主要分为浮点数(FP32/FP16/BF16/FP8)和定点整数(INT8/INT4/INT2)。FP16需要约140GB显存存储70B参数模型,INT8可压缩至70GB,INT4进一步降至35GB。FP8在NVIDIA Hopper架构(H100/H200)和Blackwell架构上获得硬件原生支持,可在Tensor Core上直接计算无需反量化,精度损失小于1%的同时推理速度比FP16快约33%。

二、大模型量化有哪些常见的量化位数?

1. FP16/BF16(16位浮点)

作为训练和高精度推理的基准精度,FP16每参数占用2字节,Llama-70B模型需约140GB显存。BF16(Bfloat16)保留了与FP32相同的指数位(8位),动态范围与FP32一致,适合大规模分布式训练避免梯度溢出。这两种精度通常作为量化效果的对比基线,在生产环境中较少直接部署。

2. FP8(8位浮点)

FP8有E4M3和E5M2两种主流格式:E4M3具有4位指数和3位尾数,精度较高适合前向推理;E5M2具有5位指数和2位尾数,动态范围更大适合KV缓存。FP8相比FP16可减少50%显存占用,推理速度提升30%-33%,困惑度增加仅0.1-0.3%,被广泛视为2026年H100及以上硬件的生产环境默认选择。

3. INT8(8位整数)

INT8提供约2倍显存压缩,精度损失通常小于1%,大多数GPU/TPU/NPU均支持INT8 Tensor Core加速。其优势在于跨平台兼容性最佳,在A100、AMD MI300X等不支持原生FP8的硬件上是首选方案。SmoothQuant等技术使INT8实现了权重和激活同时8位量化(W8A8),在OPT-66B等模型上精度损失仅0.6%。

4. INT4(4位整数)

INT4提供约4倍显存压缩(相比FP16减少75%),配合AWQ或GPTQ等先进算法可将精度损失控制在1.5-2个百分点以内。Llama-70B以INT4量化后仅需约35GB显存,可在双张RTX 4090(共48GB)或单张RTX 6000 Ada(48GB)上部署。吞吐量相比FP16可提升2.6-3.1倍,是显存受限场景的主流选择。

5. 超低比特(INT3及以下)

INT3、INT2乃至1.58-bit(如BitNet b1.58使用三值{-1, 0, +1})属于研究级方案。当比特数降至3以下时,精度下降呈非线性增长,在MMLU-Pro等基准上可能退化4-12个百分点,对代码生成、数学推理等高要求任务影响尤为显著。这类方案目前主要适用于极端资源受限的边缘场景或学术研究。

三、INT8量化和FP16量化有什么区别?

1. 数值表示方式不同

FP16采用IEEE 754标准的16位浮点格式(1位符号+5位指数+10位尾数),能够表示较大范围的实数但存在精度冗余;INT8采用8位有符号整数格式(范围-127至127),通过线性映射近似原始浮点分布。从信息论角度看,神经网络权重超过95%落在均值±3倍标准差范围内,这为整数量化提供了理论基础。

2. 精度与性能权衡

实测数据显示,对Llama-3-70B进行INT8量化后,MMLU准确率仅下降0.4%(从79.2%降至78.8%),显存从140GB减半至74GB,吞吐量提升1.8倍,延迟降低约45%。相比之下,FP8量化的精度损失更小(约0.3-0.5个百分点),但在不支持FP8的硬件上无法发挥优势。INT8在精度损失和性能提升之间提供了更均衡的选择。

3. 硬件支持差异

INT8得到最广泛的硬件支持,包括NVIDIA Tensor Core(Volta架构起)、Intel VNNI指令集、AMD MI系列以及各类NPU/DSP。FP8仅在NVIDIA Hopper(H100/H200)及更新的Blackwell架构上获得原生Tensor Core支持。对于跨平台部署或存量硬件较多的企业,INT8仍是更稳妥的选择。

4. 适用场景定位

FP16适用于对精度极度敏感的任务(如医疗诊断、法律分析、科学计算)以及长上下文(超过128K tokens)场景;INT8适用于绝大多数生产环境的通用推理任务,如客服对话机器人代码生成工具等,在保持接近FP16精度的同时实现显著的降本增效。

四、大模型量化如何降低推理成本?

1. 显存占用大幅减少

量化直接减少了每个参数占用的存储空间。以70B参数模型为例,FP16精度下需约140GB显存,INT8降至70GB,INT4进一步降至35GB。这意味着原本需要多张A100 80GB才能运行的模型,量化后可在单卡或少卡上部署,硬件采购成本成倍下降。KV Cache量化为FP8后还能额外节省50%的缓存显存,进一步提升并发能力。

2. 推理速度显著提升

低精度计算可利用硬件的专用加速单元。INT8 Tensor Core的理论算力是FP32的8倍,FP8在H100上的矩阵乘法算力可达FP16的2倍以上。实测中,INT8量化可实现1.5-2倍推理加速,INT4-AWQ配合Marlin内核可实现3倍以上加速。吞吐量的提升意味着相同硬件可服务更多用户,单位Token的处理成本相应下降。

3. 带宽压力有效缓解

大模型推理通常是memory-bound(受限于内存带宽)而非compute-bound。量化减少了数据传输量,INT4相比FP16减少了75%的权重读取带宽需求。这对于自回归生成的逐token推理尤为重要——每次生成只需从HBM读取一次权重,量化后带宽消耗成比例降低,直接转化为更低的延迟和更高的能效比。

4. 边缘部署成为可能

量化使大模型能够在资源受限的边缘设备上运行。手机端可部署30亿参数规模的模型,车载芯片可支持百亿参数模型的本地推理,XR眼镜等设备也能承载轻量级大模型。端侧部署不仅节省了云端推理的持续成本,还提供了零网络延迟数据隐私保护等附加价值。Arm等芯片厂商已将4-bit量化适配纳入其KleidiAI软件库,推动端侧AI成为行业标准。

五、大模型量化对模型精度有什么影响?

1. 精度损失的整体规律

量化精度损失与比特位数呈非线性关系。在4-bit以上通常较为安全,INT8量化在多数任务上精度损失小于1%,INT4量化损失约1.5-2.5个百分点。当比特数降至3-bit以下时,精度下降幅度急剧增大,在复杂推理任务上可能出现4-12个百分点的退化。跨模型测试显示,FP8在MMLU-Pro上的平均退化仅0.4个百分点,处于基准测试的噪声范围内。

2. 不同任务的敏感度差异

通用对话和文本生成对量化相对鲁棒,而代码生成、数学推理、长上下文检索等高精度要求任务对量化更为敏感。AWQ-4在这些挑战性任务上的退化约为1.4-1.8个百分点,GPTQ-4的退化略大(1.5-2.4个百分点)且在不同模型间方差更大。生产环境中建议在目标业务场景上构建专属评测集进行A/B测试,而非仅依赖公开基准分数做决策。

3. 异常值导致的精度崩塌

大型Transformer架构中存在少量"异常值特征"(outlier features),某些维度的激活值比其他维度大100倍以上。如果直接对这些激活值进行均匀量化,会导致量化范围被异常值拉大,正常值的量化精度严重下降甚至完全失效。LLM.int8()、SmoothQuant等方法专门针对这一问题设计,通过混合精度分解或难度迁移策略有效缓解了精度崩塌风险。

4. 精度恢复策略

对于INT4及以下量化出现的精度损失,可采用多种恢复手段:保留关键层(如embedding层、语言模型头)在FP16精度;使用AWQ等激活感知方法保护1%的关键权重;通过少量校准数据优化量化参数;或在量化后进行轻量微调(mini-QAT)。这些策略的组合使用可将INT4量化的精度损失控制在可接受范围内。

六、大模型量化对显存占用的优化效果如何?

1. 权重显存的线性压缩

模型权重显存与参数量和精度位数成正比:Weight Size (GB) ≈ Parameter Count (B) × Bits / 8。70B模型在FP16下约140GB,FP8/INT8下约70GB,INT4下约35GB。这种线性压缩关系使得量化成为降低显存需求最直接的手段。对于MoE模型如DeepSeek-V3,虽然每次推理仅激活部分专家参数,但全部权重仍需驻留显存,量化带来的显存节省同样显著。

2. KV Cache的二次优化

在长上下文场景中,KV Cache的显存占用可能超过模型权重本身。以Llama-70B在1M token上下文为例,FP16的KV Cache高达约135GB,超过140GB的权重显存。将KV Cache量化为FP8可直接减半至约67.5GB,配合GQA(分组查询注意力)或DeepSeek的MLA(多头潜在注意力)机制,可进一步将KV Cache压缩7-14倍。多重优化叠加后,1M上下文的KV Cache可从135GB降至8GB,降幅达94%。

3. 并发能力的倍数提升

显存节省直接转化为更高的并发承载能力。实测数据显示,在H100单卡80GB显存限制下,将Llama-3-8B的KV Cache从BF16改为FP8后,峰值并发请求数从170提升至1,033,实现了5倍以上的容量增长。对于70B模型,INT4量化使显存从140GB降至35GB,释放出的显存空间可用于更大的batch size或更长的上下文窗口,显著提升服务吞吐能力。

4. 混合精度部署策略

生产环境中常采用混合精度策略进一步优化显存:权重使用INT4存储,计算时按需反量化;KV Cache使用FP8;关键的embedding和lm_head层保持FP16。腾讯云TI-ONE平台的angel-vllm推理镜像即支持在线INT8/NF4/FP8的weight-only量化和LayerwiseSearchSMQ等多种量化加速方式,可根据具体模型和硬件条件灵活选择最优配置。

七、大模型量化对推理延迟和吞吐量有什么改善?

1. 延迟改善机制

推理延迟主要由首token延迟(TTFT)和解码延迟两部分组成。量化通过减少权重加载时间和内存访问次数来降低延迟。实测中,INT8量化可使延迟降低约40%-50%,INT4-AWQ可降低约50%-60%,具体效果取决于硬件平台和batch size。但对于小batch size场景,4-bit量化可能存在"解包开销"(unpacking tax)——需要将压缩的INT4权重反量化回FP16/BF16再计算,反而可能增加单次推理延迟。因此低延迟优先的场景更适合INT8或FP8。

2. 吞吐量提升规律

吞吐量(tokens/秒)的提升主要来自两个方面:一是低精度计算本身的加速(FP8比FP16快33%),二是显存节省允许更大的batch size。在高batch size(≥16)场景下,INT4量化的吞吐量可达FP16的3-4倍。vLLM框架结合PagedAttention和连续批处理技术,在H100上使用FP8量化可实现793 tokens/秒的吞吐量,P99延迟仅80ms。

3. 不同场景的最优选择

高并发云端服务推荐FP8或INT8,在H100上FP8提供最佳的精度-速度平衡;显存受限需要部署更大模型时选择INT4-AWQ,可在单张消费级GPU上运行70B模型;边缘设备和CPU推理场景选择GGUF格式(推荐Q4_K_M或Q5_K_M),在Apple Silicon上利用统一内存优势实现高效推理;追求极致吞吐的批处理任务可选择INT4-GPTQ配合Marlin内核。

4. 端到端性能实测

行业公开基准测试数据显示,在vLLM上运行Llama-3-70B时,FP8量化的吞吐量可达FP16基线的约1.9倍,INT8约为1.6-1.7倍,INT4-AWQ可达2.3倍以上。精度方面,FP8的MMLU准确率下降通常在1个百分点以内,INT8下降约2-3个百分点,INT4下降幅度更大但在多数通用任务上仍可接受。这些数据清晰地展示了精度与性能的权衡曲线,为不同场景的选型提供了实证依据。

八、训练后量化和量化感知训练各有什么优缺点?

1. 训练后量化(PTQ)的工作机制

PTQ在模型训练完成后直接进行量化,只需少量校准数据(通常128-512个样本)统计各层权重和激活值的分布范围,计算量化参数后完成映射。完整流程包括:加载预训练模型→用校准数据前向传播收集统计信息→计算scale和zero-point→转换权重为低精度格式→评估精度并调整策略。GPTQ、AWQ、GGUF等均属于PTQ范畴,整个过程通常在几十分钟到几小时内完成。

2. 量化感知训练(QAT)的工作机制

QAT在训练过程中模拟量化效果,在前向传播中插入伪量化节点(fake quantization),让模型学习适应量化噪声。反向传播时使用直通估计器(STE)绕过量化操作的不可导问题。经过若干epoch的微调后,权重自然具备对量化误差的鲁棒性。Google在Gemma 3上实践表明,仅5000步QAT即可将INT4量化后的精度损失减少54%。

3. 两者核心对比

维度

PTQ

QAT

训练成本

无需训练

需微调(原训练的约1/10时间)

数据需求

少量校准数据(约512样本)

需训练数据(1万-10万样本)

INT8精度

几乎无损(~99%)

几乎无损(~99.5%)

INT4精度

轻微下降(90%-95%保持率)

更好(95%-98%保持率)

开发周期

几小时到1天

几天到1周

适用场景

快速部署、模型微调后量化

极致精度要求、极低比特量化

4. 选型决策建议

选择PTQ的场景包括:使用预训练模型且无法获取训练数据、需要快速上线(1-2天内)、INT8/INT4精度已满足业务需求、计算资源有限无法支撑QAT。选择QAT的场景包括:拥有训练数据和充足算力、需要INT2/INT3等极低比特量化、精度要求极高(如金融、医疗领域)、需要灵活的混合精度策略。实践中也可采用混合方案:对大部分层使用PTQ,对关键层(如embedding、output层)使用QAT,在精度和成本间取得平衡。

九、大模型量化中的校准数据集如何选择?

1. 数据来源的选择

校准数据应从与模型预期使用场景分布相近的数据源中选取。常见来源包括:原始训练数据的子集(最能反映模型学到的表征分布)、验证集子集(已知代表目标任务分布)、特定任务数据(如代码生成任务选用代码数据集、对话任务选用对话语料)。重要的是校准数据不需要与训练数据完全一致,只需能代表模型实际会处理的典型输入即可。

2. 样本数量的平衡

校准样本数量在统计稳定性和计算效率之间存在权衡。研究表明,32-64个样本适合快速实验调试,128个样本提供良好的速度与质量平衡(也是AutoGPTQ等工具的默认值),256-512个样本可获得更好的统计特性但量化时间更长,1024个以上样本的收益递减明显。对于GPTQ等利用Hessian矩阵的方法,校准数据的质量比数量更重要。

3. 数据多样性的关键作用

近年研究(如COLA框架,2025)发现,校准数据在激活空间中的代表性和多样性比数据来源本身更能决定量化后的能力保持水平。有效的做法是:通过前向传播提取未压缩模型在各候选样本上的层级激活模式,利用随机投影降维后进行k-means聚类,从每个簇中选择最接近质心的样本,最大化激活空间的覆盖度。这种方法在数学推理和代码生成等复杂任务上可带来1-3个百分点的额外精度提升。

4. 序列长度与格式匹配

校准数据的序列长度应尽量匹配模型的最大序列长度(通常2048或4096 tokens),较长的序列能提供更好的统计信息,尤其对处理长文本的模型至关重要。数据格式也应与推理时的输入格式一致——如果模型主要用于多轮对话,校准数据应包含对话格式的样本;如果用于RAG场景,应包含带检索上下文的查询样本。分词必须使用与模型预训练时完全相同的tokenizer,分词不匹配是常见的精度损失来源。

十、大模型量化中的异常值(Outlier)问题如何处理?

1. 异常值的成因与影响

在参数量超过67亿的大模型中,Transformer每层的激活输出会稳定地出现少量(约0.1%)绝对值巨大的特征维度,这些异常值的幅度可达普通值的100倍以上。它们对模型性能至关重要,但会拉伸量化范围导致大量正常值被压缩到无效区间,直接量化会造成严重的精度崩塌。这一现象在LLaMA、OPT、BLOOM等各类架构中普遍存在。

2. LLM.int8()的混合精度分解

LLM.int8()由Tim Dettmers等人于NeurIPS 2022提出,核心思路是将矩阵乘法分解为两部分:从输入激活中分离出包含异常值的列(约占1-2%),这部分保持FP16精度计算;剩余98%-99%的正常值用INT8量化计算;最后将两部分结果相加。该方法几乎无损地保持了模型精度,但由于需要动态识别异常值并进行分解,推理速度可能不会比FP16更快,主要收益在于减少激活值的内存占用。

3. SmoothQuant的难度迁移策略

SmoothQuant(MIT韩松实验室,ICML 2023)提出了更优雅的解决方案:既然权重易于量化(分布均匀)而激活难以量化(存在离群点),就通过数学等价变换将激活的量化难度迁移到权重端。具体做法是引入按通道的平滑因子s,将原始矩阵乘Y = X·W变换为Y = (X·diag(s)^(-1)) · (diag(s)·W),其中α控制迁移强度(通常0.5-0.75)。变换后激活的异常值被大幅平滑,权重仍保持较均匀的分布,从而实现W8A8全INT8量化,在OPT-66B上精度损失仅0.6%,推理加速1.56倍。

4. AWQ的激活感知保护

AWQ(Activation-aware Weight Quantization,MLSys 2024最佳论文)从另一个角度解决异常值问题:不是所有权重都同等重要。AWQ根据激活值的大小识别出约1%的"关键权重",对它们乘以缩放因子进行特殊保护后再量化,其余99%的权重正常量化。这种方法无需重新训练,产生的量化格式对硬件友好,在边缘GPU上可实现3倍以上加速。与SmoothQuant将难度迁移到权重不同,AWQ直接在量化过程中保护重要信息,两者思路互补。

十一、大模型量化如何在边缘设备上部署?

1. 边缘设备的资源约束

边缘设备面临内存、算力和功耗的三重约束。高端AI手机可支持约100亿参数模型的端侧部署,PC可支持约200亿参数,车载场景可部署200亿至600亿参数的模型。但电池容量、散热能力和内存带宽远不及云端GPU,因此量化成为端侧部署的必要条件。高通已实现2-bit量化压缩,使端侧能支持的模型尺寸持续扩大;苹果AFM3系列通过稀疏架构在端侧部署约200亿参数模型,每次推理仅激活部分参数以降低算力需求。

2. GGUF格式与llama.cpp生态

GGUF是当前边缘和CPU推理的事实标准格式,由llama.cpp项目维护。它采用单文件格式(元数据、tokenizer和权重打包在一起),支持从Q2_K(约2.5 bits/weight)到Q8_0(8 bits/weight)的多种量化级别。推荐Q4_K_M(约4.5 bits/weight)作为最佳平衡点——70B模型约40GB,精度保持约98%。GGUF原生支持llama.cpp、Ollama、LM Studio等工具,在Apple Silicon上利用统一内存优势可高效运行大模型,也支持Android NPU和Qualcomm Hexagon DSP加速。

3. 异构计算与自动调度

现代边缘SDK(如NEXA SDK、Arm KleidiAI)支持跨CPU/GPU/NPU的异构后端自动调度。系统自动识别设备算力资源,在支持NPU的设备(如Qualcomm SA8295汽车芯片、Apple M系列Mac)上优先调用NPU实现低功耗高性能运行;在无专用AI芯片的设备上通过CPU/GPU优化确保基础体验。这种"一次开发、全设备运行"的模式大幅降低了端侧部署的工程门槛。

4. 端云协同的混合架构

端侧并非要替代云端,而是形成分工协作的混合AI架构。端侧承担高频、实时、隐私敏感的任务(如语音助手、个人数据理解、即时翻译),云端处理更复杂、更重的推理和规划任务。高通、Arm等厂商正推动端云协同体系,通过低时延连接技术确保端云之间的智能调度。在这种架构下,量化后的端侧模型可作为第一道处理层,仅在需要时才将请求路由至云端大模型,实现成本、延迟和隐私的最优平衡。

十二、大模型量化在云端推理场景有哪些应用?

1. 高并发在线服务

云端推理服务的核心挑战是在有限GPU资源下最大化并发承载能力。FP8量化已成为H100集群的生产默认选项——显存占用减半的同时推理速度提升33%,且精度损失在基准测试噪声范围内(-0.3至-0.5点MMLU-Pro)。配合vLLM的PagedAttention和连续批处理技术,单卡可承载的并发会话数可提升至1.8倍以上。对于日活百万级的对话服务,FP8量化可将GPU集群规模缩减近半,显著降低基础设施成本。

2. 长上下文推理优化

当上下文长度超过32K tokens时,KV Cache的显存占用开始超过模型权重本身;在128K以上KV Cache成为主导因素;在1M tokens时KV Cache可吃掉70%-90%的GPU显存。FP8 KV Cache量化可将这部分显存减半,配合DeepSeek V2/V3/V4采用的MLA(多头潜在注意力)机制实现7-14倍的KV压缩,使得经济高效地提供超长上下文服务成为可能。vLLM 0.7和SGLang 0.4均已原生支持FP8 KV Cache格式。

3. 多租户SaaS服务

在多租户场景下,不同客户可能使用不同的模型或配置。量化使得在同一GPU集群上可同时部署更多模型实例,提高资源利用率。Prefix Caching(前缀缓存)技术可复用系统提示词和few-shot示例的KV状态,在命中时节省85%-95%的计算成本。结合量化后的显存节省,多租户SaaS服务可在保持服务质量的同时大幅降低单位客户的边际成本。

4. 批处理与离线推理

对于推荐系统、搜索引擎、内容审核等批量处理场景,吞吐量是核心指标而非单次延迟。INT4量化在此类场景下表现最佳——batch size较大时可规避解包开销的影响,3-4倍的吞吐量提升直接转化为处理成本的下降。配合Marlin等优化的CUDA内核,INT4推理速度甚至可超越FP16,同时保持可接受的精度水平。

十三、当前主流的量化框架和工具有哪些?

1. vLLM与SGLang(云端生产服务)

vLLM是当前生产环境的标准LLM Serving框架,由UC Berkeley开发,支持PagedAttention、连续批处理和广泛的量化格式(GPTQ/AWQ/GGUF/FP8/INT8/INT4)。典型吞吐量为120-160 requests/秒,P99延迟50-80ms。SGLang是新一代框架,核心创新RadixAttention可实现KV缓存的高效复用,在多轮对话和Agent工作流场景下吞吐量可达vLLM的3.1倍。两者均原生支持FP8推理和FP8 KV Cache量化。

2. TensorRT-LLM(NVIDIA极致性能)

NVIDIA官方维护的推理优化库,在NVIDIA硬件上提供最高性能。支持FP8/INT8/INT4量化,H100上可实现4.6倍于A100的性能,10,000 tokens/秒在100ms TTFT下可达。Blackwell架构新增NVFP4和微缩放(microscaling)支持,承诺约3.5倍显存减少且精度损失≤1%。缺点是配置复杂(通常需要1-2周专业工程师时间),且锁定NVIDIA生态。

3. llama.cpp与Ollama(边缘与本地部署)

llama.cpp是纯C/C++实现的推理引擎,零外部依赖,可在服务器、笔记本、手机甚至树莓派上运行。原生支持GGUF格式,在Apple Silicon上表现尤为出色。Ollama基于llama.cpp封装,提供了最简单的本地大模型部署体验——pip install即可使用,自动管理模型下载和版本。两者是开发者本地实验和边缘部署的首选工具链。

4. bitsandbytes与QLoRA(微调场景)

bitsandbytes是HuggingFace生态中最广泛使用的量化后端,支持NF4(Normal Float 4)格式和QLoRA微调。QLoRA的创新在于将4-bit量化与LoRA适配器结合,使单张48GB GPU即可微调65B模型,质量与全精度微调相当。BitsandBytes的"即插即用"模式(load_in_4bit=True)极大降低了量化门槛,适合快速原型开发和资源受限的微调任务。

5. 腾讯云TI-ONE量化能力

腾讯云TI-ONE平台内置了angel-vllm推理镜像,基于开源vLLM优化,支持在线INT8/NF4/FP8的weight-only量化和LayerwiseSearchSMQ等多种量化加速方式,对生产环境高并发场景推荐使用。平台还集成了混元大模型和DeepSeek系列模型的量化部署方案,支持128K tokens长上下文多轮交互,并提供训推一体的潮汐调度能力,帮助企业实现大模型的低成本落地。

十四、大模型量化有哪些主流技术方案?

1. GPTQ(Generative Pre-trained Transformer Quantization)

GPTQ(ICLR 2023)基于二阶信息(Hessian矩阵近似)确定量化每个权重时的最优补偿策略。通过逐层量化并将量化误差"传播"到后续权重中,可在数小时内将OPT-175B和BLOOM-176B压缩到3-4 bit且精度几乎不受影响。GPTQ建立了LLM量化的工程基准,后续方法多以之为比较对象。配合Marlin CUDA内核优化后,GPTQ推理速度可比基础版本提升2.5倍。

2. AWQ(Activation-aware Weight Quantization)

AWQ(MLSys 2024最佳论文)的核心发现是:只需保护1%的关键权重即可实现近乎无损的4-bit量化。它根据激活值大小识别重要权重,通过缩放因子对其进行保护后再量化。与GPTQ的逐层二阶优化不同,AWQ更直觉、更快速且硬件友好。在多数评测中AWQ的精度一致性优于GPTQ,是当前GPU生产服务的首选4-bit方案。

3. SmoothQuant与W8A8全量化

SmoothQuant通过数学等价变换将激活的量化难度迁移到权重端,实现了无需训练的W8A8(8位权重+8位激活)全量化。在OPT-66B上精度损失仅0.6%,推理加速1.56倍,显存减半。该方法已在TensorRT-LLM和vLLM中原生集成,成为生产级INT8部署的标准技术路径。

4. FP8原生低精度推理

FP8代表了低精度推理的最新方向,利用NVIDIA Hopper和Blackwell架构的硬件原生支持,在几乎无精度损失的前提下实现显著加速。DeepSeek V3/R1和Kimi-K2等主流开源大模型已原生支持FP8精度训练和推理。随着H100/B100部署规模扩大,FP8正成为云端推理的默认精度设置,边缘侧则由INT4/INT8继续主导。

5. 前沿探索方向

复域量化通过将参数表示从实数域扩展至复数域,引入幅度和相位两个自由度,在极低比特条件下突破了实数域量化的性能天花板。BitNet b1.58挑战了"模型必须是浮点数"的基本假设,使用三值{-1, 0, +1}权重在3B规模上匹配FP16 LLaMA的表现。MXFP4(指数细粒度FP4)由OpenAI的GPT-OSS系列率先在MoE层采用,预示着未来更多模型将原生支持4-bit精度。这些前沿方向共同指向一个趋势:量化正在从"后处理压缩"演变为"原生低精度建模"。

相关文章
  • ​【大模型学习 | 量化】pytorch量化基础知识(1)
    729
  • 纯离线安装大模型推理引擎,部署量化大模型
    2.4K
  • 大语言模型--KV Cache量化论文
    2.1K
  • 【大模型学习 | BERT 量化实战(1)】
    1.1K
  • 【大模型学习 | BERT 量化实战(2) 】
    883
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券