Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction
本文指出,在视觉-语言模型的示能性预测中,主要的瓶颈在于部件接地(part grounding)而非动作知识的缺乏,并证明了通过显式指定目标物体部件可以显著提高所有测试模型的动作准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人正变得越来越擅长观察世界。它们仅凭一张照片就能识别出椅子、杯子或照相机。但在“看到”一个物体与“知道如何移动它”之间,还存在着一道鸿沟。为了让机器人变得有用,我们需要它理解“示能性”(affordances)这一概念,简单来说,就是知道一个物体是用来做什么的,以及人类或机器应该如何与其互动。如果机器人看到一个抽屉,它必须知道要拉动它;如果它看到一个按钮,它必须知道要按下它。这对人类来说似乎显而易见,但对于人工智能而言,这却是一个极其困难的谜题。研究人员一直在测试视觉语言模型——即能够观察图像并回答相关问题的系统——以观察它们是否能理解这些交互行为。结果令人失望,这些机器经常无法给出正确的指令。一个核心问题在于:这些模型是缺乏关于事物运作方式的基础知识,还是仅仅看错了图像的部分?
一位研究人员试图通过一项涉及十九种不同物体(如照相机、抽屉和盖子)的特定任务来解开这个谜团,并测试了八种不同的不同人工智能模型。他们向模型提出了一个简单的问题:给定一张物体的照片,机器人应该对其进行什么动作?正确答案被限制在了一组很小的动作集合中,例如推、拉或抬起。当模型被允许自行选择讨论物体的哪个部分时,它们的表现非常糟糕。事实上,当正确答案应该是“推”某物时,模型几乎从未提到过这个词。在六十四次应当执行“推”动作的情况下,模型仅成功了一次。在其余的时间里,它们建议的动作与实际情况完全不符。
乍一看,这似乎是知识匮乏的表现。看起来这些模型根本不知道按钮是用来按的,而抽屉是用来拉的。然而,当研究人员仔细观察模型的实际表达时,发现了一个不同的故事。模型并非对动作本身感到困惑,而是对目标对象感到困惑。当被展示一台照相机并被问及该做什么时,模型通常会描述如何拿起整个照相机机身,而不是解释如何按下背面的按钮。它们是在对整个物体提出了一个合理的问题,但却忽略了需要进行操作的具体部件。模型看错了拼图的关键部分。
为了验证这一理论,研究人员改变了实验方案。研究人员不再让模型自行选择讨论哪个部分,而是明确告诉模型应该关注哪一部分。他们说:“看这台照相机上的按钮。机器人应该对它做什么?”这种改变是剧烈的。一旦研究人员指出了具体的部件,模型的准确率便大幅提升。每一个模型都得到了进步,其成功率从约百分之十五的低点上升到了接近百分之九十五的高点。那些此前甚至无法一次正确建议“推”动作的模型,突然几乎每次都能做对。它们也开始使用正确的语言,描述按钮在按下时是如何向内移动的,即使在没有提供单词列表的情况下也是如此。
这一发现表明,问题不在于缺乏物理知识,而在于无法将问题落实到正确的空间位置。模型知道按钮的用途,只是无法可靠地在图像中找到那个按钮。研究人员还测试了模型指出机器人应该抓取物体具体位置的能力。在真实照片上,一些模型表现尚可,但在计算机生成的图像上,没有任何一个模型能比随机猜测做得更好。这证实了薄弱环节确实在于定位物体重要特定部件的能力。
这项研究还揭示了研究人员在设置测试时所犯的一些错误。他们意识到,最初衡量成功的方式在某些方面过于简单(导致模型仅通过猜测图像中心就能获得高分),而在另一些方面又过于严格(会对模型定义动作时的细微误差进行惩罚)。一旦修正了这些测量误差,结果变得更加清晰。模型缺失的不是物理规则,而是将注意力集中在正确细节上的能力。
对于任何构建机器人的人来说,其结论都是务实且具体的。如果你想让机器人操控一个物体,你不能仅仅把一张照片交给它并询问该做什么。系统需要一种方法,首先识别出物体中需要关注的具体部件。一旦该部件被命名,人工智能就能可靠地告诉你如何移动它。这些模型并非坏掉了,它们只是需要一点帮助来知道该看哪里。这种区别改变了我们对机器人未来的思考方式。与其试图教机器每一种可能的机械规则,我们或许只需要给它们更好的工具,让它们找到这个世界上值得去操作的正确部分。知识就在那里,只是需要被指向正确的方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。