← 最新论文
🤖 AI

Evidence-Gated Task and Motion Planning with Vision-Language Models

本文提出了证据获取与可行性门控(Evidence Acquisition and Feasibility Gating, EAFG)框架,该框架将视觉语言模型与任务与运动规划相结合,以动态地获取视觉证据并对规划决策进行门控,从而通过防止基于未经验证的假设进行执行,提高在部分可观测条件下长时程操纵任务中的成功率。

原作者: Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在我们的家庭和厨房中移动的机器人面临着一个根本性的挑战:它们不仅必须理解要做什么,还必须明白自己是否真的能做到。要遵循像“做汤”这样简单的指令,机器需要连接两个截然不同的世界。首先,它必须理解语言的含义,知道做汤需要鸡肉和盐等食材,并且这些物品需要加热。这是语言与常识的领域。其次,它必须理解物理世界,明确知道锅在哪里,橱柜门是否可以在不撞到墙的情况下打开,以及机器人的手臂是否能够到香料罐。多年来,研究人员一直试图将这两项技能结合起来,利用能够观察和阅读的高级计算机模型来帮助机器人规划行动。然而,一个持久的问题始终存在:当机器人观察厨房却无法看到所需的一切时,会发生什么?如果关键食材隐藏在关闭的抽屉里,或者它根本就不在那里,机器人可能会根据其训练数据进行猜测。它可能会计划去拿一个并不存在的胡萝卜,从而导致任务失败,或者让机器人在试图抓取空无一物的地方时陷入混乱。

来自早稻田大学和弗林德斯大学的一个研究小组提出了一种解决此问题的新方法,该方法迫使机器人“先看后跳”。他们的方法被称为“证据获取与可行性门控”(Evidence Acquisition and Feasibility Gating),它改变了操作顺序。机器人不再是立即根据猜测去尝试烹饪汤,而是首先扮演一名好奇的探索者。它被编程为生成旨在单纯收集信息的小型、安全的任务,例如打开关闭的橱柜或移动可能阻挡视线的箱子。一旦机器人执行了这些动作,它会拍摄一张新的场景照片。一个强大的视觉语言模型随后会审查这一新的视觉证据,以决定下一步该做什么。该系统会问一个简单但至关重要的问题:“我现在是否有足够的证据来规划烹饪任务?”如果答案是“是”,机器人便开始规划完整的烹饪步骤。如果答案是“否”,但仍有可以寻找的地方,机器人则返回探索阶段。如果答案是“否”,且显然所需物品缺失,机器人则会完全停止,而不是浪费时间尝试使用并不存在的东西。

研究人员在一个旨在模拟真实家庭复杂性的模拟厨房环境中测试了这种方法。机器人只有一个机械臂,任务是制作鸡汤,这个过程涉及寻找食材、使用炉灶以及管理各种容器。他们设置了三种不同的场景,以观察新系统与不先检查证据的旧方法相比的表现如何。在第一种场景中,所有必需品都存在且清晰列在指令中。在这种情况下,新系统的表现与标准方法一样出色,证明了增加这个额外的检查步骤并不会减慢速度或让机器人感到困惑,即使一切都很显而易见。真正的区别出现在第二种场景中,即指令比较模糊。机器人被告知要“做鸡汤”,但没有被告知要使用盐或胡椒。使用旧方法时,机器人很少成功,因为它不知道要去寻找这些隐藏的调味料。使用证据收集法后,机器人成功打开了橱柜,找到了盐和胡椒,并在百分之四十的试验中完成了食谱,这比基准方法有了显著提高。

第三种场景测试了系统识别任务是否无法完成的能力。机器人被要求用盐、胡椒和胡萝卜做汤,但胡萝卜不在厨房里。标准系统通常会陷入循环,反复尝试寻找或使用缺失的胡萝卜,从而浪费时间和精力。然而,新系统学会了停止。通过主动搜索可能存在胡萝卜的地方并发现一无所获,机器人的内部门控决定停止行动。在这些测试中,其中一个模型的停止正确率达到了百分之九十,另一个模型更是达到了百分之百,同时大幅减少了抓取缺失蔬菜的失败尝试次数。这种说出“我无法做到”的能力与成功的能力同样重要,因为它防止了机器人基于错误的假设采取行动。

研究人员承认,他们的方法并不完美。它依赖于机器人成功打开门或移动物体以获得更好视野的能力。如果机器人由于机械问题或物理限制未能打开橱柜,即使物体在那里,它也可能无法找到所需的证据。尽管存在这一局限性,这项工作仍展示了一条让机器人在不确定环境中运行的清晰路径。通过在最终规划阶段之前插入一个主动信息收集的步骤,该系统确保了机器人的行动是基于它实际看到的,而非仅仅是它所假设的。这种从“猜测”到“验证”的转变,使机器人能够更有效地处理人类空间中混乱、不完整且充满变数的现实情况,使其成为处理从烹饪一顿饭到整理房间等任务时更可靠的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →