Infer Human's Intentions Before Following Natural Language Instructions
该论文提出了 FISER,这是一个通过在规划动作之前通过社会推理显式推断人类意图,从而提高具身智能在协作任务中性能的框架,其在 HandMeThat 基准测试上的表现优于标准的端到端方法和强基线模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,有一款旨在协助家务的机器人。为了让这台机器真正发挥作用,它必须能够理解我们在日常生活中向彼此发出的那些随意的、往往是不完整的请求。当一个人在整理家务时说,“你能把沙发上的那个递给我吗?”他们并不是在真空中说话。他们假设听者能够根据共享的语境和刚刚发生的事情的历史记录,明白“那个”指的是什么。如果这个人一直在把书收进盒子里,那么机器人就应该理解“那个”是指一本书,而不是靠垫或遥控器。这种读懂言外之意、从观察到的行为中推断隐藏目标的能力,是让人工智能成为人类环境中真正伙伴的核心挑战。如果没有这项技能,机器人可能会字面上执行指令,却无法提供真正的帮助,因为它无法弥合模糊指令与完成共享任务所需的具体行动之间的鸿沟。
华盛顿大学和麻省理工学院的研究人员通过一种名为 FISER 的新方法解决了这一问题,该缩写代表“结合社会与具身推理的指令遵循”(Follow Instructions with Social and Embodied Reasoning)。他们的工作聚焦于一个特定的难点:人类的指令具有天然的歧义性,因为人们会省略那些他们认为显而易见的细节。团队在一个名为 HandMeThat 的数字环境中测试了他们的想法,这是一个文本驱动的家庭模拟环境,其中人类和机器人必须协同工作。在这种设定下,人类可能正在整理物品,并在过程中向机器人发出一个模糊的请求寻求帮助。机器人的任务是弄清楚人类究竟想要什么,不仅是通过倾听语言,还要通过观察人类一直在做什么并猜测其潜在计划。
研究人员发现,解决这一问题的最成功方法是将问题分解为两个截然不同的步骤。首先,机器人进行“社会推理”,即它会停下来明确地猜测人类的意图。它观察人类行为的历史和当前的情况,以决定此人实际上想要实现什么目标。例如,如果人类一直在把书放入盒子里,机器人就会推断出目标是存放书籍。只有在做出这种推断之后,机器人才会进入第二步——“具身推理”,即规划递交正确物体所需的物理动作。这个两阶段的过程至关重要,因为它迫使系统在尝试移动之前先解决语言的歧义性。
为了测试这一点,团队构建了可以执行这些步骤的计算机模型。他们将自己的方法与其他方法进行了比较,包括直接要求大型预训练语言模型一次性完成任务,或者使用一种称为“思维链”(Chain of Thought)的技术来引导模型进行推理步骤。结果非常明确:那些明确将社会推理与物理规划分开的模型表现得显著更好。在最具挑战性的测试中(即指令具有高度歧义性的情况),这种新方法达到了 64.5% 的成功率,创下了此类任务的新纪录。相比之下,即使是经过精心提示的最强大的预训练语言模型,也难以达到同样的水平,它们经常无法理解人类的隐藏目标,或者在环境细节中迷失方向。
研究还揭示了为什么强大的预训练模型会表现不佳。这些模型阅读了来自互联网的海量文本,拥有通识知识,但缺乏针对共享任务中即时物理语境进行推理的特定能力。当研究人员尝试通过过滤掉环境中无关物体来帮助这些模型时,模型仍然无法进行有效的规划,这表明问题不仅仅在于信息过多,而是在于将社会线索与物理动作联系起来时存在根本性的困难。研究人员得出结论,如果机器人要成为真正有用的助手,它们需要接受训练,将人类意图视为一个需要解决的特定且可观察的问题,而不是寄希望于通用的语言模型能自行搞定。通过教导系统先理解人类的思想,然后再基于这种理解采取行动,研究人员展示了一条通往更强大、更具协作能力的智能体之路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。