✨ 要点🔬 技术摘要
想象一下你正在试图教一个机器人做家务。你有两个选择。第一种是雇佣一位超级聪明的老师,一次性把所有 家务都教给他们,希望他们能学会完美地应付一切。这被称为“联合训练”(joint training)。第二种选择是雇佣两个不同的专家:一个只学习洗碗,另一个只学习叠衣服。一旦他们成为了专家,你再尝试将他们的“大脑”合并到一个机器人中,使其能够同时胜任这两项工作。这被称为“模型合并”(model merging)。
在人工智能的世界里,合并就像是一个魔术。它承诺可以在不需要重新进行联合训练的情况下,将不同专家的技能结合起来,这在无法共享数据或专家由不同的人训练时非常有用。但一个大问题悬在脑海中:合并后的效果真的能像从头开始训练一个全能机器人那样好吗?大多数人认为合并是一种聪明的变通方法,但从未有人在相同的环境下,通过公平的测试将其与作为“金标准”的联合训练进行对比。这篇论文正是为了填补这一空白,旨在探究这个魔术究竟是真实的魔法,还是仅仅是一个幸运的猜测。
研究人员利用一个名为 AppWorld 的数字游乐场搭建了一个受控实验,在这个环境中,AI 智能体必须完成各种任务,比如预订机票或订餐。他们选取了一个基础 AI 模型,并在其基础上训练了两个“专家”:一个专注于简单的任务(难度等级 1),另一个专注于稍难的任务(难度等级 2)。随后,他们又在同时 处理这两类任务的基础上训练了一个“联合”模型。接着,他们使用两种不同的合并配方(称为 TIES 和 RAM+)将这两个专家模型进行融合。最后,他们让合并后的模型与联合模型进行对决,看看谁能真正完成任务。
结果出人意意地平淡,但这种平淡具有非常特定的含义。当他们观察主要指标——即完美完成任务的数量时,所有的模型都打平了。合并后的专家模型表现得与联合模型一样出色。事实上,它们之间的差异微乎其微,以至于落入了“噪声墙”(noise wall)之中,这意味着在统计学上它们是无法区分的。无论他们是使用高级的合并配方,还是仅仅将两个大脑进行平均,结果都是一样的。论文指出,这是因为两个专家学习的方式如此迥异,以至于它们的“思维模式”(在数学上被称为任务向量)几乎互成直角。想象一下两个人朝着完全不同的方向行走;当你试图合并他们的路径时,你得到的不是一场混乱的碰撞,而是一个涵盖了两者基础的温和平均值。
作者还进行了更深入的研究,以查看是否遗漏了什么。他们发现,虽然合并后的模型获得了相同数量的满分,但有时在“部分得分”的尺度上表现稍逊一筹——这意味着它们可能完成了任务的 90%,而联合模型可能会完成 95%。然而,论文认为这并不代表合并失败,而仅仅是衡量成功方式的一种特性。合并后的模型并没有发现任何其中一个专家都不具备的新型“超人类能力”;它们只是将现有的技能进行了平均。
至关重要的是,该论文排除了“更聪明的合并方法可以解决问题”的可能性。他们测试了选择在训练过程中的特定时刻停止并进行合并是否会有所帮助,但发现,在这种特定的设置下,模型之间的“干扰”已经非常低了,因此没有什么可以修复的。论文得出结论:对于这类 AI 设置,合并是联合训练的一个完全有效的替代方案,但它并不能提供某种神奇的提升。它是一个稳健、可靠的备选方案,其效果与通过更艰难的方式训练出的模型不相上下,但它并没有打破物理定律。
技术摘要:当模型合并(Model Merging)对抗联合多任务强化学习(Joint Multi-Task Reinforcement Learning)时
问题陈述
模型合并经常被提议作为联合多任务训练的替代方案,特别是在强化学习(RL)场景中,即独立智能体已被发布,且其训练数据无法进行汇总。然而,关于合并能够匹配联合训练的说法很少能在其试图取代的基准上进行实证测试,因为在应用合并的跨领域场景中,联合模型通常是不可用的。本文通过构建一个受控对比来解决这一差距:在不相交的任务子集上训练 RL 专家模型,将其合并,并将结果与在相同数据上进行联合训练的模型进行对比。
研究方法
本研究利用了 Appworld 基准测试,这是一个带有难度标注的任务交互式数字智能体环境。实验设置包含以下组件:
基础模型与架构: 所有模型均基于 Qwen3-8B ,使用 LoRA (低秩自适应)进行微调,秩 r = 16 r=16 r = 16 ,作用于注意力(attention)和 MLP 投影矩阵。
训练机制: 专家模型使用 LOOP (Leave-One-Out Policy Optimization)进行训练,这是一种结合了 RLOO 优势与 PPO 式裁剪的无评论家(critic-free)策略梯度方法。
难度-1 专家模型: 仅在难度-1 任务上进行训练。
难度-2 专家模型: 仅在难度-2 任务上进行训练。
联合模型: 在难度-1 和 难度-2 任务的并集上进行训练。
合并策略: 专家的任务向量(相对于基础模型的参数偏移)使用以下方法进行合并:
TIES: 修剪低幅度的坐标,并通过幅度投票解决符号冲突。
RAM+: 根据支持共现性(shared vs. unique)对坐标进行划分,并放大唯一方向。
评估: 模型在留出的测试集(168 个任务)上进行评估,使用 任务目标完成度(TGC) (二元成功率)和连续性的部分得分指标(通过的单元测试比例)。
几何分析: 本文引入了一个校准的几何诊断工具,用于衡量专家任务向量之间的关系。这包括全局余弦相似度、符号一致性和支持重叠度。至关重要的是,作者将这些测量值针对 底线 (随机 rank-16 适配器)和 天花板 (同一次运行中的检查点)进行了校准,以区分学习信号与低秩参数化伪影。
核心贡献
经验零假设: 本文建立并证明,在此受控设置下,在主要 TGC 指标上,模型合并与联合多任务 RL 是 统计学上不可区分的 。此外,具备行为感知能力的合并方法(RAM+、TIES)与朴素平均法也是不可区分的。
几何解释: 作者证明,由于专家任务向量具有 近正交性 ,因此不需要复杂的合并来处理干扰。尽管存在 65% 的支持重叠 (这是由于相同的 LoRA 目标模块导致的),但其方向对齐度(余弦相似度)仍然很低(0.06–0.10)。这种微小的共享成分在训练过程中会逐渐发展,但仍明显区别于低秩初始化底线。
支持与方向的解耦: 研究揭示,在基于 LoRA 的 RL 专家模型中,支持共现性(RAM 的基础)并不意味着方向对齐。由于向量近乎正交,基于支持的合并策略会坍缩为简单的平均法,使得复杂的符号或子空间解析变得不再必要。
指标敏感性分析: 虽然连续性的部分得分指标显示合并模型的得分低于联合模型,但作者认为这并不意味着合并作为联合训练替代方案的失败。指标的反转(合并模型在 TGC 上优于联合模型,但在连续得分上表现较差)以及缺乏涌现的跨任务能力(联合性能并未超过表现最好的专家模型)表明,这种差异是由于对近正交向量进行平均而产生的机械性后果,而非能力的丧失。
结果
性能对等: 在主要指标(TGC)上,难度-1 专家模型、难度-2 专家模型、联合模型、TIES 合并模型和 RAM+ 合并模型都落在同一个统计重叠区间内(总计 12.5% – 16.1% TGC)。RL 模型之间不存在显著的成对差异(p ≥ 0.56 p \geq 0.56 p ≥ 0.56 )。
几何发现:
余弦相似度: 专家之间的全局余弦值为 0.06–0.10,在训练过程中从接近零单调上升,但在达到天花板(同一次运行检查点的 0.78–0.81)之前便已饱和。
符号一致性: 共享支持上的符号一致性约为 52%,与随机概率一致。
支持重叠: 由于共享 LoRA 模块,支持重叠度很高(~65%),但这并未转化为方向上的干扰。
合并动态: 由于向量近乎正交,TIES 和 RAM+ 实际上退化为均匀平均。RAM 中的“唯一”集合太小,不足以驱动放大效应,而 TIES 中的符号冲突由于缺乏共识而被任意解决。
检查点选择: 对“合并感知型”早期停止(即选择能最小化干扰同时最大化奖励的检查点)的分析表明,在此机制下没有杠杆作用。干扰与能力是同步增长的;用于合并的最佳点与峰值能力检查点重合,不存在“高能力、低干扰”的替代方案。
意义与主张
本文将其发现框架化为一个 校准后的零结果 :一个经过仔细界定的、描述模型合并何时有效的特征描述。
对从业者而言: 在数据可以汇总的设置中,在此规模下(8B 参数,约 10 次迭代),合并在统计上并不比联合 RL 具有优势。然而,对于 无法 汇总数据的从业者,研究结果提供了保证,即合并并不会明显牺牲联合 RL 本应达到的性能。
机制洞察: 本研究阐明,在这种情况下,合并之所以成功,并非由于合并算法(如 RAM 或 TIES)的复杂性,而是由于学习到的任务向量固有的几何特性。LoRA 专家模型的近正交性最小化了干扰,使得复杂的解耦变得不再必要。
局限性与范围: 作者对研究范围持谨慎态度,指出这些结果特定于该基准测试设置、LoRA 参数化方式以及所使用的特定难度划分。他们承认,更大的模型、不同的训练机制或全量微调可能会产生不同的几何特性,届时合并方法可能会发挥更大的作用。本文明确避免声称模型合并在普遍意义上优于其他方法,或者所观察到的“零结果”适用于所有多任务场景,而是专注于研究在何种特定条件下,合并能够匹配联合训练。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。