← 最新论文
🤖 machine learning

Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers

本文提出了一种新颖的双向学习框架,该框架通过应用保持功能的权重变换来对齐独立训练的十亿级参数 Transformer,从而实现跨语言和视觉领域的近无障碍线性模式连通性以及有效的模型合并。

原作者: Tianyi Li, Zhiqiang Shen

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyi Li, Zhiqiang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:融合两种不同的食谱

想象一下,你有两位大师级厨师,他们都花费多年时间钻研出了一款完全相同的菜肴:巧克力蛋糕。他们都知道如何让它变得美味。然而,他们在不同的厨房里学习技能,使用了不同的量杯,并且以完全不同的方式组织食材。

  • 厨师 A 把面粉放在左边的碗里,把糖放在右边。
  • 厨师 B 把面粉放在右边,把糖放在左边。

如果你试图在制作过程中简单地将他们的食谱“混合”(这个过程被称为线性插值),结果会是一场灾难。你可能最后在一个碗里放了半杯面粉和半杯糖,但因为他们的指令不匹配,蛋糕塌陷了。在 AI 世界中,这被称为损失壁垒(loss barrier)——即组合后的模型停止工作且错误率飙升的点。

问题所在:“隐藏”的差异

长期以来,科学家们认为这两位厨师只是在做不同的蛋糕。但本文指出,他们实际上是在做同一个蛋糕;他们只是拥有不同的对称性(symmetries)

在 AI 中,“对称性”意味着你可以通过重新排列组合而不改变结果。

  • 置换(Permutation): 你可以交换步骤的顺序(比如先混入鸡蛋再加牛奶,对比先加牛奶再加鸡蛋),只要相应地调整其他步骤即可。
  • 缩放(Scaling): 你可以使用大勺子或小勺子,只要相应地调整分量即可。

问题在于,当两个 AI 模型分别进行训练时,它们自然会陷入不同的“排列组合”中。如果你在修复这些排列组合之前就尝试融合它们,AI 就会感到困惑。

旧方案:单向调整

以前的方法试图通过让厨师 B 的食谱看起来像厨师 A 的食谱来解决这个问题。他们会说:“好吧,厨师 B,把你的糖移到左边,以匹配厨师 A。”

这确实有一点帮助,但就像是强行把方榫头塞进圆卯眼里。厨师 B 必须扭曲自己的整个风格来适应厨师 A 特定的厨房布局。这虽然有效,但生成的“折中”食谱仍然面临极高的失败风险。

新方案:“双向舞步”(LMC-DM)

本文介绍了一种名为**双向学习匹配(Dual Learned Matching)**的新方法。与其强迫一位厨师去模仿另一位,不如让他们双方都达成共识,在中间汇合。

想象一个舞池。与其让厨师 A 站在原地而让厨师 B 试图去匹配其步伐,不如两位厨师都开始朝着彼此跳舞

  1. 他们都学习了组织食材的新方式(调整他们的“对称性”)。
  2. 他们共同向一个共享的中立厨房布局移动,在那里,他们的步伐能够完美对齐。
  3. 一旦对齐,他们就可以平滑地融合他们的食谱。

因为两位厨师都是灵活的,并且都在朝着一个共同的目标移动,所以“折中点”不再是灾难区。它变成了一条平滑、安全的路径,让蛋糕的味道依然和原版一样好。

他们的实际发现

研究人员在大型 AI 模型上进行了测试(有些拥有数十亿个参数,这就像是一个拥有数百万种食材的厨房)。

  • 结果: 当他们使用这种“双向舞步”方法时,“灾难区”(损失壁垒)几乎完全消失了。
  • 视觉模型: 他们在图像识别模型(例如识别猫和狗的模型)上进行了测试。即使在融合两个不同的模型时,组合后的模型也能始终保持高准确率(超过 69%)。
  • 语言模型: 他们在文本生成模型(例如编写故事的模型)上进行了测试。对于中等规模的模型,错误率几乎为零。即使对于巨大的十亿级参数模型,错误率也非常小。

总结

本文证明了大型 AI 模型并非孤岛。它们实际上是由隐藏的路径连接在一起的。如果你不再试图强迫一个模型去模仿另一个,而是让两个模型都进行自我调整以在中间汇合,你就可以无缝地合并它们。

这意味着我们可以将两个不同的、经过高度训练的 AI 模型组合成一个更强大的模型,而无需从头开始重新训练或构建复杂的全新结构。这就像是意识到两种不同的语言其实只是同一种语言的不同方言,如果你能带着一点灵活性去运用它们,你就能完美地理解彼此。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →