首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型量化 >大模型量化有哪些主流技术方案?

大模型量化有哪些主流技术方案?

词条归属:大模型量化

1. GPTQ(Generative Pre-trained Transformer Quantization)

GPTQ(ICLR 2023)基于二阶信息(Hessian矩阵近似)确定量化每个权重时的最优补偿策略。通过逐层量化并将量化误差"传播"到后续权重中,可在数小时内将OPT-175B和BLOOM-176B压缩到3-4 bit且精度几乎不受影响。GPTQ建立了LLM量化的工程基准,后续方法多以之为比较对象。配合Marlin CUDA内核优化后,GPTQ推理速度可比基础版本提升2.5倍。

2. AWQ(Activation-aware Weight Quantization)

AWQ(MLSys 2024最佳论文)的核心发现是:只需保护1%的关键权重即可实现近乎无损的4-bit量化。它根据激活值大小识别重要权重,通过缩放因子对其进行保护后再量化。与GPTQ的逐层二阶优化不同,AWQ更直觉、更快速且硬件友好。在多数评测中AWQ的精度一致性优于GPTQ,是当前GPU生产服务的首选4-bit方案。

3. SmoothQuant与W8A8全量化

SmoothQuant通过数学等价变换将激活的量化难度迁移到权重端,实现了无需训练的W8A8(8位权重+8位激活)全量化。在OPT-66B上精度损失仅0.6%,推理加速1.56倍,显存减半。该方法已在TensorRT-LLM和vLLM中原生集成,成为生产级INT8部署的标准技术路径。

4. FP8原生低精度推理

FP8代表了低精度推理的最新方向,利用NVIDIA Hopper和Blackwell架构的硬件原生支持,在几乎无精度损失的前提下实现显著加速。DeepSeek V3/R1和Kimi-K2等主流开源大模型已原生支持FP8精度训练和推理。随着H100/B100部署规模扩大,FP8正成为云端推理的默认精度设置,边缘侧则由INT4/INT8继续主导。

5. 前沿探索方向

复域量化通过将参数表示从实数域扩展至复数域,引入幅度和相位两个自由度,在极低比特条件下突破了实数域量化的性能天花板。BitNet b1.58挑战了"模型必须是浮点数"的基本假设,使用三值{-1, 0, +1}权重在3B规模上匹配FP16 LLaMA的表现。MXFP4(指数细粒度FP4)由OpenAI的GPT-OSS系列率先在MoE层采用,预示着未来更多模型将原生支持4-bit精度。这些前沿方向共同指向一个趋势:量化正在从"后处理压缩"演变为"原生低精度建模"。

相关文章
五大主流数据库模型有哪些_五大主流品牌
导读:无论是关系型数据库还是非关系型数据库,都是某种数据模型的实现。本文将为大家简要介绍5种常见的数据模型,让我们来追本溯源,窥探现在流行的数据库解决方案背后的神秘世界。
全栈程序员站长
2022-09-20
2.4K0
主流的深度学习模型有哪些?
作者:阿萨姆 | 普华永道 数据科学家 量子位 已获授权编辑发布 转载请联系原作者 深度学习大热以后各种模型层出不穷,很多朋友都在问到底什么是DNN、CNN和RNN,这么多个网络到底有什么不同,作用各是什么? 趁着回答《深度学习的主要分类是什么呀?这些网络cnn dbn dnm rnn是怎样的关系?》这个问题的机会,我也想介绍一下主流的神经网络模型。因为格式问题和传播原因,我把原回答内容在这篇文章中再次向大家介绍。 在更详细的介绍各种网络前,首先说明: 大部分神经网络都可以用深度(depth)和连接结构(c
量子位
2018-03-26
3.2K0
⽬前 主流的开源模型体系 有哪些?
目前主流的开源大语言模型(LLM)体系和生态主要可以分为几个方向,从模型研发主体和技术路线来看,大致如下(截至 2024 年):
福大大架构师每日一题
2025-12-19
2.5K0
【大模型】大模型备案的限定领域有哪些?
大模型是一种机器学习中的模型,它通常用于处理大模型的数据集和复杂的任务。大模型因其出色的性能和表现备受关注。接下来就讨论以下大模型的一些限定领域都有哪些。
AI合规咨询专家
2025-08-26
4680
【杂谈】当前模型量化有哪些可用的开源工具?
模型量化属于模型优化中的重要技术之一,是非常有效地提升模型推理速度的技术方案,那么当前有哪些可用的模型量化工具呢?
用户1508658
2019-12-25
2.5K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券