跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

LoRA 与完全微调的差异:基于 MIT 光谱分析研究

基于 MIT 论文《LORA VS FULL FINE-TUNING: AN ILLUSION OF EQUIVALENCE》,利用奇异值分解(SVD)深入对比了 LoRA 与完全微调在权重矩阵结构及泛化行为上的本质差异。研究发现 LoRA 会在权重矩阵中引入“侵入维度”,导致模型在适应新任务时遗忘更多预训练知识,且在持续学习中表现较差。相比之下,完全微调在光谱上与预训练模型保持相似,泛化能力更强。结论表明,虽然低秩 LoRA 适合特定下游任务,但高秩参数化或完全微调能提供更强的鲁棒性和自适应能力,尤其是在面对分布外测试时。

BackendPro发布于 2025/2/7更新于 2026/7/2232 浏览
LoRA 与完全微调的差异:基于 MIT 光谱分析研究

LoRA 与完全微调的差异:基于 MIT 光谱分析研究

引言

微调(Fine-tuning)是将经过预训练的大语言模型应用于下游任务的关键范式。最近,低秩自适应 (LoRA) 等方法已被证明可以在各种任务上达到完全微调模型的性能,同时可训练参数的数量却大大减少。

这就引出了一个核心问题:它们学到的解决方案真的等效吗?

来自 MIT 的研究者在论文《LORA VS FULL FINE-TUNING: AN ILLUSION OF EQUIVALENCE》中进行了深入探讨。本文旨在了解两种微调大型语言模型方法之间的差异:完全微调和低秩自适应 (LoRA)。这两种方法都用于将预训练模型适应特定的下游任务,但它们却存在显著不同。

图片:LoRA 与完全微调对比

论文地址:https://arxiv.org/pdf/2410.21228v1

作者通过分析预训练模型权重矩阵的光谱特性来研究不同的微调方法如何改变模型。研究发现,完全微调与 LoRA 产生的权重矩阵奇异值分解结构有显著不同,并且经过微调后的模型在面对超出适应任务分布的测试时也显示出不同的泛化行为。

特别是,LoRA 训练的权重矩阵中出现了称为「侵入维度(intruder dimensions)」的新的高秩奇异向量,而在完全微调中则不会出现这种情况。这些结果表明,即使在微调分布上表现相同,但使用 LoRA 和完全微调更新的模型访问参数空间的不同部分。

技术背景:奇异值分解 (SVD)

为了理解微调对预训练权重的变化,本文采用神经网络参数的奇异值分解 (SVD) 进行分析。SVD 可以将一个矩阵分解为三个矩阵的乘积,揭示其内在的结构特征。通过测量用 LoRA 微调过的权重矩阵中的奇异向量或完全微调过的权重矩阵中奇异向量映射到预训练权重中的奇异向量的程度,可以使用余弦相似度来量化这种关系。

这些关系如图 1 和图 3 所示,颜色表示预训练和微调奇异向量之间的余弦相似度。在图 2 (b) 中观察到,LoRA 和完全微调的奇异向量与预训练奇异向量的相似度非常不同:与完全微调相比,使用 LoRA 微调的模型的奇异向量与预训练奇异向量的平均余弦相似度似乎要低得多。

图片:奇异向量相似度对比

图片:低相似度红点

结构差异:侵入维度的发现

在图 2 (b) 中左下角有一个唯一的红点,作者将这些新维度命名为侵入维度。其正式定义如下:

图片:侵入维度定义

LoRA 微调模型包含高秩侵入维度,而完全微调的模型则不包含。为了量化特定权重矩阵的侵入维度集的大小,作者使用了相应的算法进行计算。

图片:侵入维度量化算法

即使在 LoRA 微调模型学习效果不如完全微调的任务中,侵入维度也存在。观察相关图表,我们可以清楚地看到,即使 LoRA 的 r=256,高秩奇异向量集中仍出现侵入维度。重要的是,当 r=2048 时没有侵入维度,而是展示了与完全微调非常相似的曲线。这支持了早先的发现:随着秩增加超过一个阈值,侵入维度会消失,LoRA 开始趋向于与完全微调相似。

图片:r=256 与 r=2048 对比

即使使用满秩矩阵执行 LoRA,完全微调更新也比 LoRA 更新具有更高的有效秩。如图 6 所示,可以观察到完全微调解决方案的有效秩明显高于通过 LoRA 学习到的解决方案的有效秩,即使 LoRA 具有更高的秩。

图片:有效秩对比

行为差异:持续学习与遗忘

在较低秩的情况下,LoRA 在持续学习过程中的适应能力较差,会忘记更多之前的任务。该研究在多个任务上按顺序训练 RoBERTa,并测量学习新任务时性能的变化程度。

该研究使用与之前相同的训练方案、数据集,但在持续学习环境中使用以下数据集(按顺序)进行微调:MNLI、QQP、SST-2、SIQA、Winogrande、FEVER。在序列中某个数据集上进行训练后,将 LoRA 权重合并到模型中,并在下一个任务训练之前重新初始化,以便不受之前任务的影响。

在对特定任务进行训练后,该研究对所有任务进行测试,对于每个任务,在测试测试集之前分别重新训练分类头。这能够检查模型在这些任务上表现如何,而无需实际更改模型本身。

结果如图 8 所示。虽然 LoRA 最初与完全微调的性能相当,但较小的 LoRA 秩在持续学习过程中始终表现出更大的性能下降。特别是,对于前三个训练数据集,当 r = 1 时 LoRA 的性能下降到预训练基线以下。随着 LoRA 秩的提高,我们可以看到这种遗忘行为减少,并且更接近于完全微调,甚至在完成持续学习后在 MNLI 上的遗忘也更少。

整体情况是微妙的:虽然在某些情况下,LoRA 似乎忘记得较少,但对于某些任务(以及某些秩)事实上,LoRA 可能会忘记更多。

图片:持续学习性能下降

对于微调到等效测试精度的 LoRA 模型,可以看到一条 U 形曲线,该曲线标识了适合下游任务的最佳等级,同时最小程度的忘记了预训练分布。

图 9 报告了测量的伪损失分数。可以看到完全微调和 r = 768 时的 LoRA 之间呈现 U 形趋势。

相对于完全微调,低秩(r = 1)和高秩(r = 768)都会导致预训练分布的遗忘更大,而对于 r = 64,遗忘较少。也就是说:当 r = 1 时,使用 LoRA 微调的模型受到侵入维度的影响,并且似乎比没有侵入维度的 r = 64 有更多的遗忘。然而,当 r = 768 时,使用 LoRA 微调的模型也表现出更糟糕的遗忘,这表明由于过度参数化,它们对适应任务过度拟合。当 r = 8 和 r = 64 时,遗忘量少于完全微调。

图片:U 形遗忘曲线

专家观点

沃顿商学院副教授 Ethan Mollick 对此评论道:事实证明,使用 LoRA 定制通用 LLM(Apple 调优其设备内置模型的方式),对 LLM 的限制远大于微调,因为它们失去了一些泛化能力。原因是 LoRA 增加了不祥的侵入维度。

图片:专家观点插图

总结与建议

核心结论

  1. 结构差异:LoRA 和完全微调在结构上产生不同的参数更新,这种差异由侵入维度的存在产生。这些侵入维度是奇异向量,具有较大的奇异值,并且与预训练权重矩阵中的奇异向量近似正交。相比之下,完全微调模型在光谱上与预训练模型保持相似,不包含侵入维度。
  2. 行为差异:与完全微调相比,具有侵入维度的 LoRA 微调模型会忘记更多的预训练分布,并且表现出较差的稳健连续学习能力。具有侵入维度的 LoRA 微调模型在适应任务分布之外不如完全微调模型,尽管分布准确度相当。
  3. 秩的影响:即使在目标任务上低秩 LoRA 表现良好,但更高秩的参数化可能仍然是可取的。低秩 LoRA(r ≤ 8)适合下游任务分布,完全微调和高秩 LoRA(r = 64)让模型泛化能力更强、自适应能力更加鲁棒。然而,为了利用更高的秩,LoRA 更新模型必须是秩稳定的。

实践建议

  • 选择 LoRA 的场景:如果你的资源有限,且任务明确、数据分布相对固定,不需要频繁的持续学习或面对大量分布外数据,低秩 LoRA(如 r=8 或 r=64)是一个高效的选择。它能以极少的参数实现良好的任务适配。
  • 选择完全微调的场景:如果你需要模型具备更强的泛化能力,或者需要在多个任务间进行持续的增量学习而不希望严重遗忘旧知识,完全微调是更可靠的选择。它避免了侵入维度带来的负面效应。
  • 高秩 LoRA 的权衡:如果必须使用 LoRA 架构但希望接近完全微调的效果,可以尝试提高秩(如 r=64 或更高)。但这会增加显存占用和计算成本,需权衡收益与开销。

综上所述,LoRA 并非完全微调的完美替代品,它在效率与性能之间做出了权衡。理解其背后的光谱特性和侵入维度机制,有助于开发者根据具体业务需求做出更明智的技术选型。

目录

  1. LoRA 与完全微调的差异:基于 MIT 光谱分析研究
  2. 引言
  3. 技术背景:奇异值分解 (SVD)
  4. 结构差异:侵入维度的发现
  5. 行为差异:持续学习与遗忘
  6. 专家观点
  7. 总结与建议
  8. 核心结论
  9. 实践建议
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Stable Diffusion 本地部署与详细安装教程
  • 无人机低空智能巡飞巡检平台:全域感知与智能决策
  • 2026 年 3 月 AI 领域动态:多模态模型与开源生态热点梳理
  • CST Studio Suite Python 环境搭建指南
  • Ψ0 人形全身 VLA:基于人类视频预训练与真实机器人后训练及 AMO 下肢控制
  • C++ 类和对象:拷贝构造与赋值运算符重载详解
  • Linux initramfs 原理与实现:从内核启动到根文件系统
  • Linux Shell 脚本中 date 命令常用用法
  • Spring Cloud 微服务架构与开发实战
  • 汇川 InoRoboLab 机器人软件常规操作要点
  • Linux 新手入门:软件安装、Vim 操作与 GCC 编译基础工具链
  • 离线 Linux 服务器部署 Ollama 并运行 Qwen 大模型教程
  • OpenClaw 搭建个性化私人 AI 助手完整配置指南
  • M1 Mac 使用 Homebrew 管理 Git 多版本及 IntelliJ 配置指南
  • Android Studio 安装及环境配置指南:SDK、JDK 与 Gradle
  • OpenStock 开源股票市场平台功能与部署
  • 如何成为懂 AI 的产品经理
  • Web 团队构建 App:Capacitor 选型指南
  • Python 爬虫实战:Playwright 多浏览器并发与性能优化
  • 基于深度学习的 Python 音频特征提取与分类实战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online