探索/大模型

经典大模型arXiv:2106.09685

LoRA:低秩适配大模型

LoRA: Low-Rank Adaptation of Large Language Models

Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen

ICLR · 2022

14k 引用 · 1.6k 阅读 · 0 收藏

摘要

冻结预训练权重,只在注意力投影里插入可训练的低秩矩阵,用极少参数逼近全量微调。

Freezes pretrained weights and injects trainable low-rank matrices into attention projections, matching full fine-tuning with far fewer parameters.

提要

LoRA 冻结预训练权重,只在注意力投影中注入可训练低秩矩阵,用远少的参数逼近全量微调。它把微调从复制整模,变成存储和切换几份小矩阵。

01背景与动机

大语言模型在落地时往往要面向不同任务与领域做适配,若每次都全量微调,就意味着复制并存储一整份模型权重。随着参数规模与定制需求同时增长,这种做法在算力、显存和版本管理上都会很快变得不可持续,因此需要显著更省的适配机制。

LoRA 利用过参数化网络中权重更新往往具有低秩结构这一假设,把适配从更新全部参数转为学习很小的低秩因子。这样可以把适配所需的可训练参数量与存储开销降低多个数量级,同时尽量保留预训练已经学到的表示能力。

02核心方法

方法冻结预训练权重矩阵 W,把对 W 的更新写成两个低秩矩阵的乘积 BA,其中秩 r 远小于隐藏维度 d,并通常将这些可训练因子插入注意力相关的投影层。基座参数保持不动,只有 A 与 B 参与优化。

推理阶段可将 BA 合并回原权重,使上线模型与基座结构一致,不增加额外延迟。训练时省参数、部署时可合并,使同一套设计同时服务节省显存与稳定时延两个目标。

A_ r=8 与A_ r=64 列向量的子空间相似度(针对ΔW_q与ΔW_v)。第三、四图为前两图左下三角放大。r=8的主要方向包含于r=64,反之亦然。
1. A_ r=8 与A_ r=64 列向量的子空间相似度(针对ΔW_q与ΔW_v)。第三、四图为前两图左下三角放大。r=8的主要方向包含于r=64,反之亦然。

03结果与证据

在冻结基座、仅训练低秩适配矩阵的设定下,LoRA 能够以远少于全量微调的可训练参数逼近全量微调效果。同一基座可对应多份小矩阵,按任务保存与加载即可,而无需为每个任务复制完整模型。

由于推理可以把低秩更新合并进原权重,服务延迟与基座模型相当,便于在相同部署条件下与全量微调对照,而不必为适配器长期支付额外计算开销。

左与中:第48层两个随机种子下A_ r=64 列向量的归一化子空间相似度(分别针对ΔW_q与ΔW_v)。右:两个随机高斯矩阵列向量的相同热图。其他层见H.1节。
2. 左与中:第48层两个随机种子下A_ r=64 列向量的归一化子空间相似度(分别针对ΔW_q与ΔW_v)。右:两个随机高斯矩阵列向量的相同热图。其他层见H.1节。

04影响与意义

LoRA 成为开源大模型微调的事实标准之一,降低了团队定制模型的工程门槛。适配器体积小,使多适配器切换、风格化模型以及领域适配在运营上可行,而不必为每个变体维护完整权重副本。

训练成本可控与部署可合并相结合,推动了「共享基座 + 可插拔适配」的产品形态,让微调更容易从实验走向可维护的服务流程。

相对无适配器(r=0)基线的推理延迟百分比增幅。上行与下行分别为Adapter H与Adapter L。更大的批大小与序列长度可缓解延迟,但在线短序列场景下增幅可超30%。已调整色图以提高可见性。
3. 相对无适配器(r=0)基线的推理延迟百分比增幅。上行与下行分别为Adapter H与Adapter L。更大的批大小与序列长度可缓解延迟,但在线短序列场景下增幅可超30%。已调整色图以提高可见性。

05局限

当秩选得过低时,适配容量不足,可能在复杂任务上弱于更高容量的更新方式。在偏好对齐等场景中,LoRA 与全量微调也并不总是等价,更新的参数化形式可能影响最终行为。

因此仍需结合任务难度选择秩与注入模块;部分高要求场景可能仍需更大容量的微调,或与其他适配策略配合使用。

96层Transformer第1、32、64、96层中,ΔW_q与ΔW_v的A_ r=8 与A_ r=64 列向量之间的归一化子空间相似度。
4. 96层Transformer第1、32、64、96层中,ΔW_q与ΔW_v的A_ r=8 与A_ r=64 列向量之间的归一化子空间相似度。

06要点

  1. 01微调中有用的权重更新常常具有低秩结构。
  2. 02部署友好与训练友好可以同时成立。
  3. 03适配器是产品化微调的合适粒度。

为何入典

个人与小团队能微调大模型,靠的就是低秩适配。QLoRA 只是把它推到消费级显存。

标签

fine-tuningefficiency

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。