PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents
本文介绍了 PROBE,这是一个包含高保真模拟器(PROBE-Sim)、基准测试(PROBE-Bench)和微调方案(PROBE-Agent)的框架,旨在推进视觉语言模型智能体在操控驱动型视觉问答(Manipulation-Grounded Visual Question Answering)领域的发展,并证明了在动态、杂乱的环境中,基于工具的智能体操控显著优于仅基于感知的方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人站在一个繁忙的厨房里,被问到一个简单的问题:“我的药还在柜子里吗?”在一个完美的、空无一物的世界里,机器人只需看一眼柜门就能回答。但在现实世界中,柜子是杂乱的。一排麦片盒、一罐咖啡和一叠盘子可能会把药瓶完全遮挡住。为了正确回答,机器人不能仅仅是观察;它必须伸手、移动这些盒子,并向内窥视。这就是“看到一张图片”与“理解一个世界”之间的差距。目前的人工智能系统在分析静态图像方面表现出色,因为答案就在屏幕上。然而,当答案需要通过物理动作来揭示隐藏信息时,它们就会感到吃力。它们还不知道如何决定何时停止观察并开始行动。
NVIDIA 的研究人员构建了一种新的方法来教机器人这项特定技能,从而弥合“看”与“做”之间的鸿景。他们创建了一个名为 PROBE 的系统,这是一个用于测试和训练机器人通过物理操纵周围环境来回答问题的框架。团队意识到,如果机器人要真正对家庭有所帮助,它必须能够处理杂乱。如果一个问题无法从第一眼观察中得到解答,机器人就需要知道如何清理路径、移动物体或掀开盖子以寻找真相。为了研究这一点,研究人员不仅编写了理论,还构建了一个高保真数字世界,其中充满了近 1,800 种真实的物体,从杯子、碗到工具和容器。在这个模拟器中,一个机器人手臂可以伸手进去、抓取物品、推开它们或将它们抬起,同时上方有一个摄像头进行观察。
研究人员利用这个数字游乐场创建了一个严谨的测试,称为 PROBE-Bench。该测试包含 150 个不同的场景,要求机器人针对一张凌乱的桌子进行提问。问题涵盖了从简单的计数,如“有多少个红色的杯子?”,到关于什么东西被隐藏在其他物品之下的复杂询问。关键挑战在于,机器人不能仅通过观察快照来回答这些问题。它必须决定是否需要先移动某些东西。团队测试了八种不同的先进人工智能模型。有些模型被允许仅通过观察图像进行猜测,而另一些则被赋予了一套可以与场景进行物理交互的工具。结果显而易见:当模型被允许使用其工具移动物体时,它们回答问题的成功率显著提高。平均而言,赋予机器人行动能力使其成功率提高了 8 个百分点。对于一些性能较弱的模型,这种提升甚至更加剧烈,一旦它们能够移动物体,准确率就上升了多达 16 个百分点。
然而,研究人员发现,仅仅拥有工具是不够的;机器人还需要知道何时使用它们。在某些任务中,机器人能正确识别出它需要移动一个物体,但在另一些任务中,它会移动错误的物体或进行不必要的移动,从而导致错误。最困难的任务是那些机器人必须在没有指令的情况下,弄清楚究竟该移动哪个物体的任务。为了解决这个问题,团队开发了一种名为 PROBE-Agent 的训练方法。他们采用了一个已经擅长这些任务的非常强大、大型的人工智能模型作为“老师”。这位老师模型演示了正确的动作序列:观察、决定移动物体、移动物体,然后回答。研究人员随后教一个更小、更高效的模型去模仿这些成功的动作。
这种教学过程的效果非常出色。在接受了老师成功动作的训练后,较小的模型在执行任务时变得更加出色。它们不仅学会了使用工具,还学会了高效地使用工具。事实上,经过训练的小型模型表现得几乎与强大的老师模型本身一样好。它们还展现出了泛化能力,这意味着它们可以将学到的知识应用于从未见过的新物体和新类型的问题。例如,当被要求寻找特定盖子下隐藏的东西时,即使盖子是一种全新的物体类型,经过训练的模型也能找出正确的动作序列。随后,团队将这些训练好的模型应用到了现实世界中的真实机器人上。尽管机器人在数字模拟中接受的是俯视视角的训练,而现实中的机器人使用的是前视摄像头,但训练好的模型仍然表现得非常好。它成功地应对了真实的杂乱桌面,移动了真实的物体,并以很高的准确度回答了问题,证明了在模拟器中学到的技能可以迁移到现实中。
这项工作凸显了机器人领域的一个重要进步。它表明,如果机器人要在我们的家庭中发挥作用,它们必须超越被动观察。它们需要成为环境中的积极参与者,能够通过改变场景来寻找所需的答案。虽然目前的系统并不完美,在处理最复杂的步骤任务时仍有困难,但研究证明,教导机器人将视觉与物理动作结合起来是一条可行的发展路径。通过使用模拟器来训练模型如何操纵它们的世界,研究人员正在为能够真正理解并与混乱的人类生活进行交互的机器人奠定基础。这项研究表明,未来有用机器人的关键不仅在于看得更清,更在于有目的地行动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。