DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA
DeicticVLA 将语言、视觉-语言和视觉指令模式统一为一个单一的视觉-语言-动作模型,通过将它们规范化为文本提示词和指示性掩码,证明了其相比于仅基于语言的基准模型在未见物体和表达方面具有更优越的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机器人手臂正坐在厨房里,准备随时提供帮助。为了告诉它该做什么,人类可能会说:“拿起左边那个红色的杯子。”这看起来很简单,但对于机器来说,世界往往充满了许多红色的杯子,或者看起来几乎一模一样的杯子。如果人类试图更加具体,比如说:“拿起左边第三个红色的杯子,就是蓝色餐巾旁边的那个,”机器人仍可能会感到困惑。现代机器人正变得越来越擅长理解语言,但当指令过于详细,或者眼前的物体与它们在训练期间学习到的精确图像不匹配时,它们往往会遇到困难。它们可能会仅仅因为某个物体看起来更熟悉而抓错东西,从而忽略了人类刚刚说出的具体词汇。
为了解决这个问题,研究人员一直在探索一种与机器交流的不同方式:使用指向手势。就像人类可能会说“拿这个”并用手指着物体一样,机器人也可以被教导通过屏幕上的点击来理解一个直接的命令。这种被称为“指示性手势”(deictic gesture)的方法,通过展示明确的意图,消除了语言带来的困惑。然而,直到现在,机器人通常只能被训练为只听从语言,或者在被指点时同时听从语言,但很少能同时处理所有这些沟通方式。一项新研究引入了一种统一这些方法的方法,允许一个单一的机器人大脑在听从句子、听从句子并配合指向手势,或仅仅跟随一个指向之间进行无缝切换。
研究人员使用一种被称为“视觉-语言-动作模型”(Vision-Language-Action model)的人工智能,开发了一个名为 DeicticVLA 的系统。这些模型就像机器人的大脑,读过数百万本书并看过数百万张图像,学习如何将所见之物与应做之动作联系起来。挑战在于,要让这个大脑足够灵活,能够接受三种不同类型的输入:文本命令、结合指向手势的文本命令,或仅仅是指向手势。在第一种模式下,用户输入完整的句子。在第二种模式下,用户输入包含像“这个”或“那里”之类的词汇的句子,并点击屏幕来定义该词所指的对象。在第三种模式下,用户点击他们想要移动的物体以及他们想要放置的位置,而不说任何话。
为了实现这一点,团队创建了一个翻译步骤,将这三种不同的输入转化为相同的内部格式。当用户点击屏幕时,系统使用一种强大的图像分析工具,将那次点击转化为一个精确的物体轮廓——即一个高亮显示人类所触碰之处的掩码(mask)。如果用户说话了,文本提示就是他们的语言。如果他们只是点击,系统会使用一个默认短语,如“遵循视觉指令”。这样,机器人的大脑始终接收到一个一致的包:一条文本指令和一个目标的视觉高亮。研究人员随后测试了将这种视觉高亮输入机器人大脑的不同方式。他们尝试在摄像机图像上画出一个框围住物体、淡化场景的其他部分以使物体脱颖而出,或者将轮廓作为单独的信息层与图像一起输入,供机器人处理。
团队首先在模拟环境中测试了这些想法,这是一个数字世界,机器人可以在其中进行数千次练习而不会损坏任何东西。他们发现,该系统可以成功学习同时处理所有三种指令模式。当机器人被要求执行从未见过的任务时,例如从新的家具布局中拿起物体,或通过新的空间描述识别物体时,指向方法比单纯使用语言的效果要好得多。在一个涉及完全相同的黑色碗的任务中,机器人必须拿起靠近特定参考物体的那个,纯语言方法在大多数情况下都失败了。然而,当用户指向正确的碗时,机器人几乎每次都能成功。研究表明,两阶段训练法至关重要:机器人首先学习遵循文本命令,然后学习将这些命令与指向手势相结合。这种顺序有助于机器人在获得跟随指向的新技能的同时,保持其理解语言的能力。
为了验证这在现实世界中是否有效,研究人员构建了一个带有机械臂、摄像头和平板电脑的物理装置。他们教机器人拿起积木、将积木放入碗中以及整理填充玩具。他们用机器人从未听过的指令进行了测试,例如在仅被训练过“最右侧”指令的情况下,要求它拿起“最左侧”的积木;或者要求它移动一种它从未见过的特定类型的玩具。在这些困难场景下,仅依赖语言的机器人表现挣扎,经常猜错或无法行动。但当用户指向目标时,依靠指向的成功率大幅提升。在一个涉及全新类别填充玩具的测试中,仅靠语言的机器人成功率仅为六分之一左右。然而,基于指向的方法却达到了完美的成功率。机器人不需要知道玩具的名字或它所属的类别,它只需要看到人类指向哪里即可。
结果表明,人机交互的未来可能不在于是在说话和指向之间做出选择,而在于同时拥有两者。该系统允许用户从一个句子开始,如果机器人显得困惑,可以简单地通过指向来澄清。或者,对于快速的常规任务,用户可以直接指向而不必说话。研究表明,虽然语言在描述复杂概念方面非常强大,但指向是识别混乱多变世界中特定物体的一种更可靠的方式。通过将这些方法统一到一个系统中,研究人员创造了一种更灵活、更鲁棒的方式来引导机器,确保机器人不仅理解我们说了什么,还理解我们的真实意图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。