← 最新论文
💬 NLP

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ\Delta Integration into Upcycled MoE

本文介绍了一种名为\method 的数据高效方法,该方法将稠密模型上循环为混合专家架构,并整合后训练参数增量以扩展多语言能力,从而无需昂贵的持续预训练或复杂的对齐,即可有效平衡新语言习得与原有模型能力的保持。

原作者: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比,对论文《DeltaMoE:通往多语言大语言模型的数据高效路径》的解读。

核心难题:“双语厨师”的困境

想象你有一位世界级的大厨(即大型语言模型),他是烹饪英语菜肴的专家,技艺精湛。现在,你希望这位大厨也能学会烹饪匈牙利语、塞尔维亚语和孟加拉语菜肴。

传统的方法是送这位大厨去一所庞大的烹饪学校进行长期学习(称为持续预训练)。他们会研读成千上万本这些新语言的食谱。但这里有个陷阱:

  1. “健忘”的大厨:如果他们在这些新语言上钻研得太深,可能会开始忘记原本的英语食谱。
  2. “稀释”的大厨:如果你试图小心谨慎,将旧的英语知识与新知识温和地融合,结果他们会在两者上都变得平庸。他们不会忘记英语,但也无法在新语言上变得精通。

这就是论文中讨论的“权衡”:你通常必须在“学好新语言”和“保持旧技能完美”之间做出选择,很难两者兼得。

解决方案:DeltaMoE(“专业厨房”方案)

作者提出了一种名为DeltaMoE的新方法。与其试图通过重新训练整个大脑来让大厨变得更聪明,不如给大厨配备一套专业化的厨房升级

其运作原理分为三个简单步骤:

第一步:构建“专家混合”厨房(升级利用)

想象大厨的厨房得到了扩建。不再是只有一个发生所有事情的大操作台,而是建立了一个**专家混合(MoE)**厨房。

  • 原始操作台(冻结专家):大厨将原本的英语操作台保持原样,完全锁定。这里没有任何变化。这确保了他们永远不会忘记英语食谱。
  • 新操作台(可训练专家):他们专门为新语言(匈牙利语、塞尔维亚语、孟加拉语)建造了三个全新的操作台。
  • 领班(路由器):他们聘请了一位聪明的领班。当顾客点英语菜肴时,领班将他们送往原始操作台;当顾客点匈牙利语菜肴时,领班将他们送往匈牙利语操作台

大厨只在操作台上进行学习。原始操作台保持冻结,因此英语技能得到了完美保留。

第二步:"Delta"嫁接(魔法迁移)

现在,新操作台擅长烹饪食物,但它们不知道如何礼貌地与顾客交流或遵循复杂的指令(这称为对齐)。通常,你需要训练它们数月才能学会这一点。

论文的巧妙之处在于Delta 合并

  • 想象还有另一位著名大厨(一个预训练的“指令”模型),他已经是与顾客交流及遵循规则的专家,但他只讲英语。
  • 作者没有从零开始训练新操作台,而是提取了这位著名大厨与其原始基础模型之间的**“差异”(即 Delta)。这就像是一张写在便签纸上的“礼貌食谱”**。
  • 他们将这张便签纸贴到了新操作台上。因为新操作台是用与原始模型相同的“面团”制作的,所以这份“礼貌食谱”能立即生效。

结果:新操作台现在既能烹饪匈牙利语食物,又能礼貌交谈,而无需经历昂贵且数据密集的训练过程。

为何这比旧方法更好

论文将这种方法与其他方法进行了测试,发现:

  1. 不再需要权衡

    • 旧方法 A(平均法):试图混合旧技能和新技能。结果:大厨的英语变差了,新语言也只是勉强过得去。
    • 旧方法 B(直接 Delta 法):试图直接将新技能粘贴在上面。结果:大厨在新语言上表现优异,但忘记了如何说英语。
    • DeltaMoE:大厨英语精通(因为原始操作台被冻结),并且新语言也精通(因为新操作台学习了这些语言,并获得了“礼貌”嫁接)。
  2. 数据高效

    • 其他方法需要数百万个示例来教导模型如何在一种新语言中表现得礼貌。
    • DeltaMoE 通过从现有模型中“嫁接”这种能力,免费获得了这一功能。它节省了海量的时间和计算资源。
  3. 可扩展性

    • 作者证明,即使你添加更多的语言(例如从 3 种增加到 8 种),系统也不会崩溃。领班(路由器)只需学会将订单发送到正确的操作台,系统就能保持稳定。

总结

DeltaMoE 就像给一位名厨配备了一个专业化、模块化的厨房。

  • 他们保持原始工作区原封不动,以保护核心技能。
  • 他们为新的语言添加新的工作区。
  • 他们无需重新训练,就能立即将“客户服务技能”迁移到新的工作区。

这使得 AI 模型能够流利且礼貌地掌握多种新语言,同时不会失去原有的智能,也不需要海量的新数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →