← 最新论文
💻 computer science

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

本文提出了 MergeVLA,一种通过引入任务掩码稀疏激活 LoRA 适配器以及将动作专家模块中的自注意力替换为交叉注意力,从而在架构层面解决多技能融合难题的通用视觉 - 语言 - 动作智能体,使其能够在无需监督任务推断的情况下实现跨任务、跨形态和跨环境的高效泛化。

原作者: Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

发布于 2026-03-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何让机器人变得更聪明、更全能的故事。

想象一下,你正在训练一个机器人管家。

1. 遇到的难题:专才变全才的困境

目前的机器人模型(叫做 VLA,即“视觉 - 语言 - 动作”模型)很厉害。如果你专门训练它叠衣服,它叠得非常好;如果你专门训练它倒水,它倒得也很稳。

但是,如果你想把这两个技能合二为一,让同一个机器人既能叠衣服又能倒水,传统的做法是直接“混合”这两个模型。

这就好比你想把一位擅长做菜的厨师和一位擅长修车的技师强行融合成一个人。结果呢?这个人既不会做菜,也不会修车,甚至可能连路都走不稳。

在论文中,研究人员发现,直接把针对不同任务训练好的机器人模型“平均”在一起,成功率几乎降到了零。为什么?因为这两个模型在内部“打架”了。

2. 为什么会打架?(两大原因)

研究人员像侦探一样拆解了模型,发现了两个导致“融合失败”的罪魁祸首:

  • 原因一:大脑里的“记忆冲突”
    机器人的“大脑”(视觉 - 语言部分)在学习新任务时,会修改自己的内部参数。就像你在学“叠衣服”时,大脑里的一些神经元被激活了;学“倒水”时,另一些神经元被激活了。
    当你强行把两个模型合并时,这些被不同任务修改过的神经元会互相干扰。就像两个人同时往一个方向拉绳子,结果绳子断了,谁也没拉动。

  • 原因二:手脚的“过度依赖”
    机器人的“手脚”(动作执行部分)在学习时,会形成一种自我依赖。比如,它为了叠衣服,把手部的动作和之前的步骤紧紧绑在一起,形成了复杂的内部循环。这种“死记硬背”的依赖关系,让它无法灵活地切换到“倒水”的模式。就像一个人习惯了用左手写字,突然要换右手,结果因为肌肉记忆太深,手完全不听使唤。

3. 解决方案:MergeVLA(合并大师)

为了解决这个问题,作者提出了一种叫 MergeVLA 的新架构。你可以把它想象成给机器人设计了一套**“模块化智能系统”**:

  • 策略一:给大脑戴上“智能眼镜”(任务掩码)
    以前是强行把两个大脑融合。现在,MergeVLA 给大脑戴上了一副**“智能眼镜”(任务掩码)**。

    • 当机器人需要叠衣服时,眼镜会遮住所有与“倒水”相关的神经元,只让“叠衣服”的神经元工作。
    • 当需要倒水时,眼镜切换,遮住“叠衣服”的部分。
    • 比喻:就像你同时拥有“厨师”和“技师”两个身份,但当你做饭时,你自动屏蔽掉修车的念头,专心致志;修车时,屏蔽掉做饭的杂念。这样就不会打架了。
  • 策略二:给手脚装上“通用关节”(移除自注意力)
    原来的手脚动作太“死板”,每一步都依赖上一步。MergeVLA 把这种死板的依赖拆掉了,让手脚的动作更多地依赖大脑给出的通用指令。

    • 比喻:以前是“因为我要叠衣服,所以我的手必须这样动”;现在是“大脑告诉我‘去拿杯子’,我的手就根据这个指令去拿杯子”。这样,无论大脑下达什么指令,手脚都能灵活应对。
  • 策略三:聪明的“调度员”(测试时路由)
    在实际工作中,机器人往往不知道下一秒要做什么任务(比如你突然说“把那个红色的方块推过去”)。
    MergeVLA 内置了一个**“调度员”**。它看一眼眼前的场景,瞬间判断出:“哦,这是推方块的任务!”然后立刻戴上“推方块”的眼镜,启动“推方块”的手脚模块。

    • 比喻:就像餐厅里有一个聪明的领班,客人刚进门,领班就根据客人的穿着和表情,瞬间判断他是想吃中餐还是西餐,并立刻把客人引到对应的厨师面前,而不需要客人自己去找。

4. 成果:真正的“全能机器人”

经过这套改造,MergeVLA 展现出了惊人的能力:

  • 在虚拟世界里:它在一个叫 LIBERO 的测试中,成功完成了多种复杂的任务(如整理房间、操作物体),成功率高达 90% 以上,甚至超过了单独训练每个技能的专家。
  • 在真实世界里:作者把它装在一个真实的机械臂上(SO101),让它学会了拿方块、推方块、叠方块。即使方块的颜色变了(环境变了),它依然能完美完成任务。

总结

这篇论文的核心思想就是:不要试图把两个完全不同的专家强行融合成一个“四不像”,而是设计一种架构,让它们能在同一个身体里“和平共处”,根据任务需求灵活切换。

这就好比我们人类,既可以是医生,也可以是画家。我们不需要把两种技能混在一起变成一种奇怪的能力,而是通过大脑的切换机制,在不同场景下调用不同的技能。MergeVLA 就是让机器人拥有了这种**“切换技能”的超能力,向着真正的通用人工智能(Generalist Agent)**迈出了重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →