← 最新论文
💬 NLP

Not How Many, But Which: Parameter Placement in Low-Rank Adaptation

本文表明,在 GRPO 训练下,LoRA 的 B 矩阵中可训练参数的具体位置对性能至关重要,而随机位置在监督微调中已足够,并提出了一种快速、低成本的评分方法,用于识别那些始终集中在残差流写入投影上的关键参数。

原作者: Arijit Sehanobish, Charles Lovering

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Arijit Sehanobish, Charles Lovering

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《不是数量,而是选择:低秩适应中的参数放置》的解释。

核心理念:重要的不是团队规模,而是你雇佣了谁

想象你拥有一座巨大且极其聪明的图书馆(大型语言模型),它几乎无所不知。你想教它一项新技能,比如解决数学问题或编写代码。

通常,为了教这座图书馆,你可能会尝试雇佣一整支新的导师团队来与它并肩工作。但雇佣一整支团队既昂贵又缓慢。因此,研究人员开发了一种名为LoRA(低秩适应)的方法。与其雇佣一整支团队,不如雇佣一支微小且专业的“适配器”团队。

问题在于:
长期以来,人们认为唯一重要的是你雇佣了多少人。如果你有雇佣 100 名导师的预算,你就从帽子里随机抽取 100 个人,并祈祷他们足够优秀。

这篇论文提出了一个不同的问题: 你挑选的100 个人重要吗?如果你预算固定,是随机挑选 100 个人更好,还是挑选 100 个真正胜任工作的特定人选更好?

答案是:这取决于你如何教导他们。


场景一:教室(监督微调 / SFT)

类比: 想象一位老师正在给全班学生进行清晰、循序渐进的讲座。大家都在听讲,指令一致。

  • 发生了什么: 在这种设置下,“梯度”(告诉模型该学习什么的信号)非常稳定且清晰。它们大致指向同一个方向。
  • 结果: 你挑选哪 100 个人并不重要。因为指令如此清晰,几乎任何随机挑选的 100 人小组都能理解课程并有效学习。
  • 论文主张: 在这里,随机选择完全可行。

场景二:密室逃脱(强化学习 / GRPO)

类比: 现在,想象你把模型放进一个混乱的密室逃脱游戏中。没有老师。模型必须尝试不同的方法,有时它解开谜题时会听到“叮”的一声(奖励),有时则什么都没有。反馈是嘈杂的、令人困惑的,并且每次都在变化。

  • 发生了什么: “梯度”(信号)变得混乱不堪。它们指向四面八方,许多信号相互抵消。这就像在浓雾中试图寻找方向,而指南针却在疯狂旋转。
  • 结果: 如果你随机挑选 100 个人,大多数人都会感到困惑。他们会向前迈一步,然后向后,再向侧面,最终回到原点。他们什么也学不到。
  • 论文的发现: 然而,有一小群特定的人确实接收到了信号。他们是那些尽管存在噪音,仍能持续朝正确方向移动的人。
  • 解决方案: 作者创建了一个“评分系统”。在训练开始之前,他们进行一个快速测试(耗时不到 10 秒),以查看适配器团队中哪些特定人员能持续响应信号。
  • 结果: 当他们只挑选那些特定的“明星球员”(即“电路”)时,模型即使预算极小也能完美学习。而当他们随机挑选人员时,模型则完全失败。

“电路”的发现:寻找明星球员

作者并非凭空猜测谁是明星球员。他们使用了一个巧妙的技巧:

  1. 快速测试: 在正式训练开始之前,他们让模型查看几个示例,观察其“大脑”如何反应。
  2. 评分: 他们为适配器中的每一个微小部分打分。如果某部分对任务表现出持续强烈的反应,它就获得高分;如果它感到困惑或反应随机,它就获得低分。
  3. 选择: 他们挑选得分最高的部分,只允许它们进行学习。

类比: 想象你试图修理一台巨大而复杂的机器。与其试图拧紧每一颗螺丝(这既缓慢又昂贵),不如使用一种特殊传感器,找出唯一那颗一旦转动就能修好整台机器的螺丝。论文发现,对于强化学习,你只需要转动非常特定且微小的一组螺丝,就能让机器运转起来。

这些“明星球员”住在哪里?

论文还研究了这些重要部分位于模型“大脑”的何处。他们发现了一个规律:

  • 阅读者与书写者: 最重要的部分是那些“读取”进入模型注意力机制的信息的部分,以及那些将信息“写回”主思维流的部分。
  • 类比: 将模型想象成一家工厂。随机部分就像是仓库中间那些只是来回搬运箱子的工人。而“电路”部分则是装卸工(负责读取/装车)和发货员(负责发送包裹/书写)。如果你想改变工厂生产的产品,你需要培训装卸工和发货员,而不是仓库中间的那些人。

结果总结

  • 对于标准训练(SFT): 随机选择完全可行。信号清晰,任何人都能学习。
  • 对于强化学习(GRPO): 随机选择会失败。信号充满噪音。你必须使用“评分系统”来找到那些特定且一致的部分。
  • 效率: 这个评分系统极其快速(不到 10 秒)且廉价(不到训练成本的 0.5%)。
  • 性能: 通过挑选正确的参数“电路”,模型可以达到与训练整个适配器相同的高性能,但使用的资源却微乎其微。

简而言之: 当训练信号充满噪音时(如强化学习中),重要的不是你训练了多少参数,而是你训练了哪些参数。找到正确的那些,就像在干草堆中找到那根真正藏着金子的针。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →