首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型量化 >大模型量化的基本原理是什么?

大模型量化的基本原理是什么?

词条归属:大模型量化

1. 数值精度映射

量化的数学本质是将连续的高精度浮点数值映射到有限的离散整数空间,通常使用仿射变换实现:Q(x) = clamp(round(x/s + z), q_min, q_max)。其中x为原始浮点数,s为缩放因子(scale),z为零点(zero-point),q_min和q_max为整数表示范围。反量化过程为D(Q(x)) = (Q(x) - z) × s,在推理时将低精度值还原参与计算。

2. 对称与非对称量化

对称量化的零点固定为0,计算效率高但对非对称分布的数据敏感;非对称量化的零点可调整,能更精确匹配数据分布但需要额外的零点存储和计算开销。实际应用中,权重量化多采用对称方式,激活量化则根据数据分布特性选择。

3. 量化粒度

量化粒度决定了scale和zero-point的共享范围,直接影响精度和计算效率。Per-Tensor量化整个张量共享一组参数,计算简单但精度较低;Per-Channel量化每个输出通道独立计算参数,精度更高适合权重量化;Per-Group量化将通道划分为多个组(典型group size为64或128),每组独立量化,在精度和效率间取得平衡,是AWQ、GPTQ等先进算法的基础。

4. 浮点与定点表示

深度学习中的数值表示主要分为浮点数(FP32/FP16/BF16/FP8)和定点整数(INT8/INT4/INT2)。FP16需要约140GB显存存储70B参数模型,INT8可压缩至70GB,INT4进一步降至35GB。FP8在NVIDIA Hopper架构(H100/H200)和Blackwell架构上获得硬件原生支持,可在Tensor Core上直接计算无需反量化,精度损失小于1%的同时推理速度比FP16快约33%。

相关文章
54_模型优化:大模型的压缩与量化
随着大型语言模型(LLM)的快速发展,模型规模呈指数级增长,从最初的数亿参数到如今的数千亿甚至万亿参数。这种规模扩张带来了惊人的能源消耗和训练成本,同时也给部署和推理带来了巨大挑战。2025年,大模型的"瘦身"已成为行业发展的必然趋势。本文将深入剖析大模型压缩与量化的核心技术、最新进展及工程实践,探讨如何通过创新技术让大模型在保持高性能的同时实现轻量化部署,为企业和开发者提供全面的技术指导。
安全风信子
2025-11-16
1.2K0
​【大模型学习 | 量化】pytorch量化基础知识(1)
九年义务漏网鲨鱼
2025-06-25
7290
纯离线安装大模型推理引擎,部署量化大模型
继续介绍大模型推理引擎+Llama.cpp,前文我写了# 内网部署 llama.cpp,运行量化大模型,详细介绍了 llama.cpp 这个推理引擎,内网离线 cmake 编译安装、开启 GPU 加速、Llama.cpp 的使用及核心参数深度解析等。
Ai学习的老章
2025-10-11
2.4K0
大语言模型--KV Cache量化论文
论文地址:[2402.02750] KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache (arxiv.org)
aaronwjzhao
2024-05-30
2.1K0
【大模型学习 | BERT 量化实战(1)】
👉 这种量化方式虽然简单,但存在一个明显的问题,这是方式是 HuggingFace 基于 bitsandbytes 库 实现的轻量量化方式,背后用的是:
九年义务漏网鲨鱼
2025-06-27
1.1K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券