Emergent Compositional Skills in Mixture-of-Experts VLAs
本文证明,配备简化混合专家(MoE)动作头的视觉-语言-动作(VLA)模型,仅通过专家演示,即可涌现出将复杂机器人任务分解为可重用的、可解释的低层原语及高层序列策略的能力,在实现与单体基线相当性能的同时,提供了更高的模块化程度和可解释性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅遵循僵化、预先编写好的脚本,而是能够通过将问题分解为更小、更易处理的部分来真正“思考”如何解决谜题的世界。这是现代机器人学的梦想——在这个领域中,科学家们正在教机器如何观察世界、理解人类语言,并移动手臂去完成任务。长期以来,最聪明的机器人就像是才华横溢但单一的“天才”:它们被训练成一个巨大的、不可分割的大脑。如果你想让它们学习一个新技巧,通常必须重新训练整个大脑,而且很难解释它们究竟是如何做到的。它们只是照做了。但如果,与其拥有一个巨大的大脑,我们能教会机器人拥有一个由专家组成的团队呢?如果它能学会说:“好吧,我需要抓起这个杯子,然后我需要移动它,然后我需要松手,”并将每一个步骤分配给一个知道如何精准完成该特定工作的不同“专家”呢?这就是研究人员正在提出的重大问题:我们能否构建出一种机器人,让它们仅仅通过观察人类完成任务,就能自动学习如何组织自己的技能,而不需要我们为每一个动作都写一份说明书?
这篇论文通过一种被称为“混合专家”(Mixture-of-Experts, MoE)的巧妙技巧探讨了这一想法。把机器人的大脑想象成一个繁忙的厨房。在传统的设置中,你有一个试图同时完成切菜、煎炸、摆盘和清洁所有工作的巨型主厨。这种方式可行,但既混乱又难以理解。作者尝试了不同的方法:他们给了机器人一位“主厨”(称为路由器)和一群专业的“副手厨师”(即专家)。主厨会观察当前的情况——机器人看到了什么、人类说了什么,以及机器人的手臂处于什么位置——然后决定下一阶段由哪位副手厨师来主导。令人兴奋的是,机器人并没有被告知这些副手厨师是谁,或者他们应该承担什么工作。科学家们只是让机器人从零开始自主学习。
结果表明,机器人实际上独立完成了一些了不起的事情。它不仅仅是在模仿人类;它学会了将任务分解为可重用的、截然不同的技能。例如,其中一位“专家”学会了成为“抓取者”,擅长抓取像马克杯或摩卡壶这样细长的手柄。另一位专家成为了“放置者”,专注于最后轻轻放下物体的动作。第三位则成为了“撤回者”,学习在松手后抬起手臂。这些行为并非随机产生的;它们是机器人在处理不同任务(如将马克杯放入微波炉或将锅放在炉灶上)时反复使用的、一致且可重用的行为。这位“主厨”学会了在这些专家之间无缝切换,将它们缝合在一起以实现复杂的长期目标。
更令人着迷的是,机器人并不需要一份预设的技能清单。它自己理清了层级结构。当机器人执行任务失败时,它并不会原地打转;它会不断重复相同的已知技能序列(比如尝试抓取、移动、然后释放),这使得它的错误变得易于理解。研究人员发现,尽管机器人使用的是一个复杂的系统,但其表现与标准的、拥有“巨型大脑”的机器人一样出色,同时还具备了模块化和可解释性的额外优势。这表明,我们可能不需要构建复杂的规划器或手工编写技能库,而是只需要给它们合适的结构,让它们仅从数据中学习如何组合自己的技能。虽然某些技能仍对特定任务具有一定的局限性,但这项研究有力地表明,这种“专家团队”的方法是迈向能够适应、解释自身行为并更自然地学习新事物的机器人的一个充满前景的步骤。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。