QLoRA 是什么?
微调大模型最大的门槛是显存:一个 70B 的模型,光权重就要上百 GB,普通人根本摸不起。QLoRA 的做法是把「量化」和 LoRA 组合起来——先用量化把模型的权重精度压到 4-bit,让底座变得极轻,再往上面挂一个 LoRA 外挂去训练。结果就是:一张消费级显卡(比如 24GB 的 4090)就能微调以前想都不敢想的大模型。它凭什么能省这么多?
量化:把权重「压缩」到 4-bit模型权重原本用 16-bit 或 32-bit 存,QLoRA 用 4-bit 存储,显存需求一下子降了一个数量级。
只在需要时解压
推理或训练的那一步才把 4-bit 临时还原成更高精度,平时就一直以压缩形态待在显存里。
LoRA 只训练小外挂
底座被冻结,训练只更新插在上面的低秩矩阵,训练所需的梯度显存也大幅减少。
它还解决了什么问题?
让「个人微调」成为可能过去微调大模型是实验室和大厂的事,QLoRA 之后,个人研究者、创业团队用一张游戏显卡就能开工。
效果接近全参微调
论文显示,QLoRA 在很多任务上能和全量微调打得有来有回,却只要几分之一的显存和时间。
使用 QLoRA 要注意什么?
它依旧是一个「性价比」方案,量化会带来轻微精度损失,对极苛刻的任务,全参微调仍可能略胜一筹。但就绝大多数场景而言,QLoRA 的省心程度远超那点代价。一句话记住:QLoRA = 量化压底座 + LoRA 训外挂,让你用一张消费级显卡,就把大模型微调这件事「平民化」了。
评论