经典大模型arXiv:2106.09685
LoRA:低秩适配大模型
LoRA: Low-Rank Adaptation of Large Language Models
Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen
ICLR · 2022
14k 引用 · 1.6k 阅读 · 0 收藏
摘要
冻结预训练权重,只在注意力投影里插入可训练的低秩矩阵,用极少参数逼近全量微调。
Freezes pretrained weights and injects trainable low-rank matrices into attention projections, matching full fine-tuning with far fewer parameters.
提要
LoRA 冻结预训练权重,只在注意力投影中注入可训练低秩矩阵,用远少的参数逼近全量微调。它把微调从复制整模,变成存储和切换几份小矩阵。
01背景与动机
大语言模型在落地时往往要面向不同任务与领域做适配,若每次都全量微调,就意味着复制并存储一整份模型权重。随着参数规模与定制需求同时增长,这种做法在算力、显存和版本管理上都会很快变得不可持续,因此需要显著更省的适配机制。
LoRA 利用过参数化网络中权重更新往往具有低秩结构这一假设,把适配从更新全部参数转为学习很小的低秩因子。这样可以把适配所需的可训练参数量与存储开销降低多个数量级,同时尽量保留预训练已经学到的表示能力。
02核心方法
方法冻结预训练权重矩阵 W,把对 W 的更新写成两个低秩矩阵的乘积 BA,其中秩 r 远小于隐藏维度 d,并通常将这些可训练因子插入注意力相关的投影层。基座参数保持不动,只有 A 与 B 参与优化。
推理阶段可将 BA 合并回原权重,使上线模型与基座结构一致,不增加额外延迟。训练时省参数、部署时可合并,使同一套设计同时服务节省显存与稳定时延两个目标。

03结果与证据
在冻结基座、仅训练低秩适配矩阵的设定下,LoRA 能够以远少于全量微调的可训练参数逼近全量微调效果。同一基座可对应多份小矩阵,按任务保存与加载即可,而无需为每个任务复制完整模型。
由于推理可以把低秩更新合并进原权重,服务延迟与基座模型相当,便于在相同部署条件下与全量微调对照,而不必为适配器长期支付额外计算开销。

04影响与意义
LoRA 成为开源大模型微调的事实标准之一,降低了团队定制模型的工程门槛。适配器体积小,使多适配器切换、风格化模型以及领域适配在运营上可行,而不必为每个变体维护完整权重副本。
训练成本可控与部署可合并相结合,推动了「共享基座 + 可插拔适配」的产品形态,让微调更容易从实验走向可维护的服务流程。

05局限
当秩选得过低时,适配容量不足,可能在复杂任务上弱于更高容量的更新方式。在偏好对齐等场景中,LoRA 与全量微调也并不总是等价,更新的参数化形式可能影响最终行为。
因此仍需结合任务难度选择秩与注入模块;部分高要求场景可能仍需更大容量的微调,或与其他适配策略配合使用。

06要点
- 01微调中有用的权重更新常常具有低秩结构。
- 02部署友好与训练友好可以同时成立。
- 03适配器是产品化微调的合适粒度。
为何入典
个人与小团队能微调大模型,靠的就是低秩适配。QLoRA 只是把它推到消费级显存。
标签
相关论文
InstructGPT:让模型听人话
Training language models to follow instructions with human feedback
FlashAttention:把注意力写成 IO 感知算法
FlashAttention: Fast and Memory-Efficient Exact Attention
LLaMA:开放基础模型的分水岭
LLaMA: Open and Efficient Foundation Language Models
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。