← 最新论文
🤖 machine learning

Multi-Objective Bayesian Optimization for Model Merging

本文介绍了 MOBO-Merge,这是一个采用多目标贝叶斯优化来高效选择权重空间中多个模型合并参数的框架,证明了其在各种合并算子和模型配置下均优于随机搜索的性能。

原作者: Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo, Monojit Choudhury

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Utkarsh Agarwal, Vamshi Bonagiri, Raul Astudillo, Monojit Choudhury

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位厨师,多年来致力于完善两种不同的食谱:一个是世界上最好的巧克力蛋糕,另一个是最美味、最复杂的千层肉酱面。你拥有一个神奇的厨房,在那里你不能只是把食材混合在一个碗里然后听天由命;相反,你必须将整个完成后的蛋糕和肉酱一层一层地进行融合,从而创造出一种全新的菜肴。这就是人工智能(AI)模型合并的世界。在这个计算机科学领域,研究人员获取两个或多个已经针对特定任务进行了训练的 AI 模型——比如一个擅长解决数学问题,另一个擅长编写代码——并尝试将它们合并成一个单一的、更聪明的模型,而无需从头开始重新训练。

困难之处在于如何确定“如何混合”。如果你按 50-50 的比例混合,你可能会得到一个既不像蛋糕也不像肉酱的平庸之作。如果你按 90-10 的比例混合,你可能会完全失去肉酱的味道。这被称为**合并参数(merge parameter)**问题。通常情况下,寻找完美的混合比例就像是在一堆干草中通过随机抓取一把把干草来寻找一根针。这既昂贵又耗时,而且往往令人沮丧,因为你无法看到引导你的“食谱”(AI 背后的数学原理)。这篇论文提出了一个简单但功能强大的问题:我们能否使用一种智能的、基于猜测的策略,比随机猜测更快地找到最佳混合比例?


智能厨师的 AI 模型混合指南

认识一下 MOBO-Merge,这是本论文介绍的这位新的“智能厨师”。作者们(来自穆罕默德·本·扎耶德人工智能大学的一个团队)意识到,混合 AI 模型有点像是在寻找两种竞争口味之间的完美平衡。你希望你的新 AI 既擅长指令遵循(听从你的指令),又擅长数学推理(解决问题),但通常,让它在其中一项变得更好,会使它在另一项上稍微变差。

作者并没有试图寻找一个单一的“完美”混合比例,而是决定寻找 帕累托前沿(Pareto front)。你可以把它想象成一张所有“最佳折衷方案”的地图。在这张地图上,每一个点都代表一种混合比例,在这种比例下,你无法在不损失指令遵循能力的情况下获得更多的数学技能,反之亦然。目标不是只选出一个赢家,而是发现整个优秀的选项图景,以便你可以根据自己的需求做出选择。

问题所在:“黑盒”厨房

挑战在于,测试一个新的混合比例是非常昂贵的。为了看一个混合比例是否奏效,你必须构建这个新的 AI 模型,并让它通过数百个测试问题。这就像是为了尝一小口味道而烘焙一整个蛋糕。你不能在烘焙过程中进行品尝(没有可以引导你的“梯度”),而且你的“食材”是有限的(测试预算有限)。

如果你只是尝试随机混合(比如对着靶子投掷飞镖),你可能会走运,但也会浪费大量的时间和食材。如果混合食谱很简单(比如只有一个旋钮来混合两个模型),随机猜测还不算太糟。但如果食色的食谱很复杂——比如为蛋糕的不同层设置了不同的旋钮——那么随机猜测就会变成一场灾难。

解决方案:“智能猜测”机器

作者创建了 MOBO-Merge,这是一个使用 多目标贝叶斯优化(Multi-Objective Bayesian Optimization) 的框架。用通俗的话说,这是一个“智能猜测”机器。

它是这样工作的:

  1. 代理模型(The Surrogate Model): 它不再每次都去烘焙一个蛋糕,而是根据它已经测试过的少量混合比例建立一个“预测图”。它会学习:“哦,当我们混合 30% 的模型 A 和 70% 的模型 B 时,数学得分上升了,但指令遵循得分下降了。”
  2. 采集函数(The Acquisition Function): 这是机器的直觉。它观察地图并询问:“我下一步应该在哪里进行测试以获取最多的信息?”它不仅仅是在寻找最高分,它还在寻找哪些位置能帮助它绘制出最好的“折衷地图”(帕累托前沿)。
  3. 循环(The Loop): 它选择一个新的混合比例,进行测试,更新它的地图,然后重复此过程。

作者在两个著名的 AI 系列上进行了测试:Qwen3-4BLlama-3.1-8B。他们尝试了多种不同的混合方式:

  • 线性(Linear): 一种简单的混合(一个旋钮)。
  • TIES: 一种更复杂的方法,试图修复模型之间“冲突”的指令(四个旋钮)。
  • 块线性(Block-Linear): 一种将 AI 的不同层视为独立块的方法,允许进行非常精细的混合(四个或八个旋钮)。

他们的发现

结果就像是一场带着聪明地图的寻宝游戏。

  • 简单混合: 当混合比较简单(只有一个旋钮)时,“智能猜测”(MOBO-Merge)只比随机猜测稍好一点。事实上,在针对 Qwen 模型的一个特定测试中,随机猜测甚至表现得稍微好了一点点。这表明对于简单的食谱,你不需要超级计算机来寻找混合比例。
  • 复杂混合: 但当混合变得复杂时(使用具有多个旋钮的 TIES 或 Block-Linear 方法),MOBO-Merge 展现出了卓越的实力。它找到了比随机猜测更好的混合比例。例如,在使用 Llama 模型配合 TIES 方法时,MOBO-Merge 找到的混合比例明显优于随机搜索所能找到的结果。
  • “三模型”挑战: 作者还尝试同时混合三个模型(指令 + 数学 + 代码)。在这里,智能猜测的优势巨大。在一次针对 Llama 模型的测试中,MOBO-Merge 找到的混合比例比最好的随机混合比例高出两倍多。

一个非常有趣的发现是,并不存在一种单一的“最佳”混合方法。有时,简单的 线性(Linear) 方法效果最好;有时,复杂的 TIES块线性(Block-Linear) 方法会胜出。这完全取决于你正在混合哪些 AI 模型以及你想要实现什么目标。

为什么这很重要

论文指出,MOBO-Merge 是任何试图组合 AI 模型的人的强大工具。它并没有发明一种新的混合模型的方法;相反,它提供了一种更聪明的搜索正确混合比例的方法。

通过使用这种方法,研究人员可以在不需要进行数千次昂贵测试的情况下,找到高质量的组合 AI 能力。它将一个曾经靠运气的过程变成了一种系统性的探索。作者发现,在 12 种不同的测试场景中,有 11 种情况下 MOBO-Merge 都找到了比随机猜测更好的“折衷地图”。

然而,作者也谨慎地指出,这并不是解决一切问题的万灵药。该方法仍然需要运行测试,这需要成本和时间。它在混合食谱复杂时效果最好,并且不能保证混合比例在每一个任务上都能完美运作。但对于那些希望在不从头开始重新训练的情况下,构建灵活、多技能 AI 系统的人来说,这种“智能猜测”的方法提供了一条更高效的路径。

最后,论文表明,虽然我们无法总是预测出超级 AI 的完美食谱,但我们确实可以停止盲目猜测,开始利用一点数学直觉来探索各种可能性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →