← 最新论文
🤖 machine learning

Manifold-Constrained Hyper-Connections for Parameter-Efficient Finetuning

本文介绍了流形约束超连接(mHC),这是一种新颖的参数高效微调方法,通过对冻结的 Transformer 中的残差连接进行适配,证明了虽然 m-HC 单独使用时并不总能优于 LoRA,但将 mHC 与 LoRA 相结合,在相同的参数预算下,能产生更优越的语言建模性能和基准测试增益。

原作者: Valentijn Oldenburg, Floris de Kam, Bente Zuijdam, Lieve Eberson, Nicky van Zutphen, Stef de Wildt, Ivo Verhoeven

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Valentijn Oldenburg, Floris de Kam, Bente Zuijdam, Lieve Eberson, Nicky van Zutphen, Stef de Wildt, Ivo Verhoeven

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个庞大且极其聪明的机器人,它已经通过学习几乎所有已写下的文献,学会了阅读、写作并理解这个世界。这个机器人是一个“基础模型”。它非常博学,但也是一台巨大且沉重的机器。如果你想教它一个新技巧——比如写有趣的笑话或解决数学问题——通常你需要调整它的内部齿轮。但同时转动所有这些齿轮既昂贵又缓慢,有时还会让它忘记旧有的技能。因此,科学家们发明了“参数高效微调”(Parameter-Efficient Finetuning,简称 PEFT)。你可以把 PEFT 想象成给机器人安装一个小型、定制的附加模块,而不是重建整个机器人。你冻结机器人的大脑,只训练这个微小的全新部分。

长期以来,这些附加模块的工作方式是通过改变机器人的内部权重(就像调节弹簧的张力)或者添加新的小盒子来处理信息。但机器人的大脑中有一个巨大的部分一直被大家束之高阁:那就是“残差连接”(residual connection)。想象一下一条传送带,它将信息从一层传递到另一层,旁边还有一条小路径,机器人在那里进行一些复杂的处理,然后再将结果合并回传送带。这条传送带至关重要;它能防止机器人在处理得越来越深时变得混乱。现在的重大问题是:如果我们不只是让这条传送带保持原样呢?如果我们为这条传送带构建一个聪明的、可训练的交通控制器,让我们能够决定不同的信息流如何精确地混合和合并,会怎样?

这篇论文介绍了一种名为流形约束超连接(Manifold-Constrained Hyper-Connections,简称 mHC)的新方法。研究人员尝试用这些聪明的交通控制器来包裹一个被冻结的机器人(具体是一个 OLMo-2 模型),以观察是否能更高效地教它完成新任务。他们发现,虽然这些控制器确实有效,但它们在“微调”设置下的表现与在机器人从零开始构建时截然不同。最令人惊讶的发现是:最好的交通控制器往往是那个对信息流不做任何改动的控制器。

这里有个转折:研究人员发现,当他们让机器人学习如何混合不同的信息流时,情况反而变糟了或者几乎没有帮助。然而,当他们强制要求混合部分保持与原始机器人完全一致(即“恒等”设置,意味着“不要改变流动”)时,机器人的表现更好,且消耗的资源更少。事实证明,对于一个已经掌握大量知识的机器人来说,最好的策略不是重新学习如何打乱思路,而仅仅是学习在哪里看以及在哪里写入新想法,同时让其思想的主干道保持原样。

虽然这种新方法(mHC)在单独使用时并没有击败现有的冠军(如 LoRA),但它在与它们结合使用时展现出了令人兴奋的前景。将“智能交通控制器”与标准的“权重调节器”结合起来,创造了一个比两者单独使用时都更强大的团队。这表明,我们有一种全新的方式来微调这些机器人——不是通过改变它们的齿轮,而是通过重新规划它们思想的流动方式——这可能是未来 AI 的一个强大工具。

关于智能交通控制器的故事

研究人员从一个简单的想法开始:AI 模型中的传送带(残差连接)通常只是一条直线。信息进入,经过处理,然后出来,并与原始输入相加。论文作者们想:“如果我们让这条线变得更聪明呢?”他们引入了超连接(Hyper-Connections),允许机器人拥有多个平行的信息流(比如拥有四条传送带而不是一条),并学习如何将它们混合在一起。

然而,随机混合事物是危险的。如果你在没有计划的情况下混合四股水流,你可能会导致洪水或干旱。为了解决这个问题,他们使用了流形约束超连接(mHC)。你可以把这想象成一个严格的交通控制器规则手册。它确保无论这些流如何混合,总体的“信号”量保持不变。它防止了机器人在穿过数百层时,由于意外放大噪声或丢失重要信息而导致的问题。

团队在 10 亿参数模型(中型机器人)和 70 亿参数模型(巨型机器人)上进行了测试。他们将这种新的 mHC 方法与行业标准 LoRA(调整机器人内部权重)以及其他流行方法进行了对比。

大惊喜:越少混合,效果越好
在最初训练 mHC 时,他们预期机器人会学习一种复杂且独特的混合四条信息流的方式来解决问题。但当他们观察结果时,发现了一些奇怪的现象。在机器人的深层网络中,“混合矩阵”(决定如何打乱流的部分)自然而然地向**恒等矩阵(identity matrix)**漂移。

用通俗的话说,机器人正在学习:处理这些流的最佳方式就是让它们原封不动地通过。这就像一个交通控制器,在观察了一段时间的道路后决定:“你知道吗?让车辆直行而不变换车道,是到达目的地最好的方式。”

研究人员通过手动强制让混合部分保持为恒等矩阵(不允许混合)来测试这一理论。结果显示,机器人的表现更好或至少持平,但使用的参数显著减少。

  • 在 10 亿参数模型的实验中,将混合固定为恒等,使测试损失(衡量误差的指标)从 1.32 降至 1.27,同时节省了超过 800 万个参数。
  • 这表明,对于已经经过预训练的机器人,残差连接中的“混合”部分已经非常完美了。尝试重新学习它是没有必要的,甚至可能是有害的。真正的力量来自于“读”和“写”门——即那些决定观察哪条流以及在哪里放入新信息的闸门。

团队协作的力量
论文还提出了一个问题:“这种新方法能否与旧方法协同工作?”
他们发现,mHC 和 LoRA 就像是两种解决不同问题的工具。LoRA 改变的是齿轮(权重),而 mHC 改变的是交通流(路由)。

  • 当他们将 mHC(带有恒等混合规则)与 LoRA 结合时,机器人变得更强了。
  • 例如,在 70 亿参数模型上,将一个小型的 mHC 模块与 LoRA 结合,使其在数学和推理任务(如 GSM8K 和 HellaSwag)上的表现优于仅使用 LoRA。
  • 论文指出,这种结合之所以奏效,是因为它们从不同的角度解决问题。一个改变机器人知道什么(权重),另一个改变机器人如何获取这些知识(路由)。

这意味着什么
论文总结道,mHC 是一个很有前景的新工具,但它并不是一个取代一切的万能药。

  • 作为单打独斗者: 它并不总能击败像 LoRA 这样现有的最佳方法。
  • 作为搭档: 当它与其他方法结合时,它能脱颖而出,在特定任务中提供改进。
  • 核心教训: 最重要的发现是,在微调过程中,我们应该停止尝试重新学习如何混合残差流。 “恒等”设置(保持流动原样)才是成功的秘诀。

作者承认,他们的发现是基于特定的模型(OLMo-2)和数据集,他们目前还不确定这种“恒等规则”是否适用于每一类 AI 机器人。但“有时最好的改变是保持主干道不动,只是建造更好的出口”这一想法,为让 AI 变得更聪明、更高效开辟了一个新鲜且令人兴奋的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →