全量微调之所以昂贵,是因为它要求对基座模型的每一个参数计算梯度、保存优化器状态,显存和算力开销随模型规模线性放大。LoRA 的省钱逻辑并非简单的"偷工减料",而是从根本上重构了这笔成本的结构:既然基座模型已经具备通用能力,适配一个具体任务往往只需要对权重做小幅度的方向性修正,那么为这次修正付出的成本,就应当只与修正量挂钩,而不是与整个模型挂钩。

实现这一点靠的是低秩分解的数学假设。LoRA 冻结基座的全部原始权重,只在关键层注入一对低秩矩阵,用两个小矩阵的乘积去近似权重的增量。训练时反向传播只更新这对小矩阵,可训练参数量从整个模型压缩到一小部分。显存开销随之大幅下降——主流优化器需要为每个可训练参数额外维护动量等状态,可训练参数越少,这部分占用就越小,中等规模的开源基座因此能在普通硬件上完成适配。
成本节约体现在三个相互独立的环节:
需要明确的是,这套逻辑成立有前提。LoRA 本质是在基座能力边界内做方向性调整,表达空间受低秩约束。如果业务数据与基座的训练分布差异过大,或需要注入全新的领域知识,低秩增量可能力不从心,此时更合理的路径是结合检索增强生成补充知识,而非强行加大微调力度。另外,可训练参数少确实缓解了过拟合风险,但不等于免疫:训练数据与真实流量分布不一致时,测试集上的好表现依然可能在上线后失效,这也是原文强调用真实对话回放做迭代的原因。
判断 LoRA 是否划算,可以看三个条件:基座能力是否已覆盖任务的大部分需求、可用算力是否有限、是否需要为多个场景维护各自的适配版本。三者满足两条,LoRA 通常就是当前约束下的成本最优解——先用它跑通小实验,以两周左右的真实流量验证效果,再决定是否追加投入。
参与讨论
暂无评论,快来发表你的观点吧!