量化是什么?
模型里的每个参数,原本都用 32 位甚至 16 位的浮点数存储,精度高,但占地方。量化,就是把这些高精度数字,压成 8 位、4 位甚至更低的整数——就像把高清照片压成体积更小的格式,肉眼差别不大,文件却小了好几倍。它为什么有用?
省内存一个 70 亿参数的模型,32 位要占约 28GB,压到 4 位只要 3.5GB 左右,普通电脑也装得下。
提速
整数运算比浮点更快,推理速度能明显提升。
降门槛
正因为量化,大模型才能跑在手机、笔记本上,而不是只能住在云端。
量化会「变笨」吗?
会有一点精度损失,但通常很小。好的量化方法会找「代表值」、或保留关键层不量化,把损失压到最低。实践里,8 位量化几乎无损,4 位量化在多数任务上也可接受。常见的量化手段
训练后量化(PTQ)模型训练完,直接压缩,简单快速。
量化感知训练(QAT)
训练时就模拟量化误差,让模型提前适应,精度更高。
它意味着什么?
量化让「人人本地部署大模型」成为可能,也是 GGUF、AWQ、GPTQ 这些格式的底层逻辑。它是大模型从实验室走向每个人设备的桥梁。一句话记住:量化,就是给大模型「瘦身」,用一点点精度换大幅度的省内存和提速。
评论