DiMaS: Distribution Matching for Steering Vision-Language-Action Models
本文介绍了 DiMaS,这是一种分布匹配引导策略,它通过传输表示分布而非沿固定方向偏移,克服了经典线性方法的局限性,从而实现了基于流匹配的视觉-语言-动作模型中的细粒度行为控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅遵循僵化的脚本,而是能够真正“感知”到轻微的推搡与粗暴的撞击之间的区别的世界。这就是视觉-语言-动作(Vision-Language-Action, VLA)模型的领域——人工智能的一个前沿角落。在这里,计算机通过摄像头学习观察世界,通过语言理解指令,然后物理性地移动机械臂来完成任务。可以将这些模型想象成一个超级聪明的头脑,它读遍了所有的书并看过了所有的视频,现在正试图弄清楚如何使用一双机械手。
但问题在于:虽然这些机器人在“做什么”(比如“拿起杯子”)方面变得越来越出色,但在“如何做”方面仍然有些笨拙。我们希望能够告诉它们:“拿起杯子,但动作要慢一点”,或者“把它拿起来,但不要抬得太高”。在人工智能领域,这被称为行为控制(behavioral control)。长期以来,科学家们尝试通过简单地在机器人的内部“想法”中进行直线推移来控制它们,就像稍微把车向左推一下让它转向一样。然而,这篇论文指出,对于最新、最先进的机器人来说,这种直线式的推移是不够的。这就像是试图通过仅仅告诉舞者“向左移动”来引导一场复杂的舞蹈,而这场舞蹈实际上需要旋转、下蹲和跳跃同时进行。
于是,DiMaS(分布匹配引导,Distribution Matching for Steering)登场了,这是由 Pegah Khayatan 及其团队提出的一种新方法。DiMaS 不再只是将机器人的内部想法向单一方向推,而是扮演着一位大师级编舞师的角色,它会观察整个“慢速”动作群体和整个“快速”动作群体。它学习“慢速”群体的精确形状和“快速”群体的精确形状,然后轻轻地重塑机器人当前的“想法”,使其符合“慢速”群体的模式。
研究人员在两个目前最智能的机器人大脑——SmolVLA 和 上测试了这一方法,使用的是一个名为 LIBERO 的虚拟游乐场,在那里机器人必须执行诸如堆叠积木或移动物体等任务。他们发现,旧有的“直线型”方法表现得并不稳定;有时有效,但经常无法改变机器人的速度或高度,或者导致机器人完全无法完成任务。相比之下,DiMaS 成功地教会了机器人移动得更慢或将物体抬得更低,并且在做到这些的同时,还能确保机器人按计划完成工作。
团队还发现了一些关于旧方法为何失败的迷人现象。他们窥视了机器人的大脑内部,发现虽然你可以很容易地分辨出“快速”的想法和“慢速”的想法(它们很容易区分),但你无法仅通过添加一个简单的数字就将一种想法转化为另一种。这种关系过于复杂,就像试图通过单向拉伸将正方形变成圆形一样;你需要重塑整个形状。DiMaS 正是如此:它重塑机器人的内部状态,以匹配期望的行为。
或许最令人印象深刻的是,研究人员测试了这种新技能是否可以迁移到机器人从未见过的任务中。他们用一组谜题教会机器人如何缓慢移动,然后要求它解决完全不同的谜题。该方法表现得相当出色,这表明机器人学到的是关于“缓慢移动”的一般规则,而不仅仅是记住了某个特定游戏的特定技巧。虽然当任务变得非常不同或机器人需要长时间移动时,机器人的表现略显吃力,但这种在不破坏“完成任务”能力的前提下控制机器人“如何移动”的能力,是向前迈出的重要一步。
简而言之,这篇论文表明,要真正控制先进的机器人,我们需要停止将它们的内部思维视为我们可以随意调大或调小的简单旋钮。相反,我们需要将它们视为复杂的景观,利用一张地图(DiMaS)来引导它们从一种行为模式过渡到另一种行为模式,确保它们在整个过程中依然能完美地起舞。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。