← 最新论文
💻 computer science

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation

本文通过将实例目标导航(Instance Goal Navigation)重新定义为一个成本敏感的不确定性降低问题,解决了以往交互式导航方法效率低下的问题,并引入了一个带有成本感知指标的新基准以及一个零样本多模态大语言模型(MLLM)导航器,该导航器仅在预期信息增益足以证明交互成本合理时才会选择性地向智能体(oracle)进行查询。

原作者: Xunyi Zhao, Sihao Lin, Gengze Zhou, Zerui Li, Shijie Li, Wei Tao, Jiajun Liu, Qi Wu

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xunyi Zhao, Sihao Lin, Gengze Zhou, Zerui Li, Shijie Li, Wei Tao, Jiajun Liu, Qi Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个被委派去在一间房子里寻找特定物品的机器人,比如“那个蓝色的杯子”。但问题在于,有十个蓝色的杯子分别放在不同的桌子上,而你并不知道老板到底想要哪一个。这就是**实例目标导航(Instance Goal Navigation)**的问题。

这篇论文指出,虽然机器人可以寻求帮助,但它们经常会问错误的问题,或者问得太多,从而浪费时间与精力。作者们提出了一种新的机器人交互方式:“在值得提问时提问”(Ask When It Pays)。

以下是他们利用简单的类比对解决方案进行的拆解:

1. 问题所在:“免费建议”陷阱

想象你在一个巨大的商场里迷路了。你可以向一位热心的陌生人(“先知”)询问方向。

  • 旧方法: 之前的机器人方法将所有问题都视为免费的。因此,机器人可能会问:“是红色的吗?”“是蓝色的吗?”“是在左边吗?”“是在右边吗?”它可能会通过问 20 个问题来找到答案,虽然提高了成功率,但却耗费了大量时间。
  • 问题点: 问一个能提供巨大线索的问题(比如“它在厨房里”)是非常有价值的。而问一个只能提供微小线索的问题(比如“它是闪亮的吗?”)则价值较低。如果机器人不知道这两者的区别,它就会把它的“交互预算”浪费在廉价的问题上。

2. 解决方案:“成本意识”策略

作者将提问行为视为一种消费行为。

  • 价格标签: 他们分析了数千条人类导航日志,以确定哪些类型的问题最有帮助。他们为每种类型分配了一个“成本”:
    • 外观问题(“是红色的吗?”):低成本。
    • 位置问题(“在厨房里吗?”):中等成本。
    • 路径问题(“在走廊左转”):高成本(因为这是一个大提示)。
    • 确认问题(“是这一个吗?”):低成本。
  • 策略: 机器人的程序现在被设定为:只有当答案的价值大于提问的成本时,才会提出问题。这就像决定是否购买彩票:只有当潜在奖金值得票价时,才去购买。

3. 新型机器人:TANDEM

作者构建了一个名为 TANDEM 的机器人来测试这个想法。可以将 TANDEM 想象成一个两人协作的团队:

  • 规划器(大脑): 这是一个大型 AI,它观察房间、记忆走过的路径,并决定下一步要做什么。它决定是移动、停止还是提问。它并不了解具体的行走方式,它只了解“目标”。
  • 执行器(腿部): 这个部分将规划器的模糊想法(例如“走到那把椅子旁”)转化为实际的物理步伐,确保机器人不会撞到墙壁。

TANDEM 如何提问:
Tandem 不会随机提问,而是在正确的时间询问特定类型的问题:

  • 早期阶段: 它会询问关于外观或区域的问题,以缩小寻找目标的范围。
  • 中期阶段: 如果在走廊交叉口感到困惑,它会询问一个路径问题,以获得大致方向(例如,“房间在餐桌后面”)。
  • 后期阶段: 它会进行确认提问,以确保它没有停在错误的杯子面前。

4. 结果:更聪明,而非更努力

研究人员创建了一个新的测试环境(数字模拟环境),他们可以在其中控制房间内“假”杯子(干扰物)的数量,从而增加任务难度。

  • 发现: 那些随意提问的机器人(“天真型”方法)经常会感到困惑或浪费时间。而 TANDEM(仅在“划算”时提问)则效率更高。
  • “顿悟时刻”: 论文发现,当机器人真正感到困惑时(例如在复杂的走廊路口),TANDEM 会问最多的问题。它不是为了聊天而提问,而是为了解决特定的难题。
  • 衡量指标: 他们引入了一个名为**加权成功率(Weighted Success Rate)**的新评分标准。这个分数不仅计算机器人是否找到了物体,还会扣除每一次昂贵提问的分数。TANDEM 胜出是因为它不仅找到了物体,而且消耗的“交互金钱”最少。

总结

这篇论文教会了机器人一个宝贵的教训:不要只是寻求帮助;要在正确的时间寻求正确的帮助。 通过将提问视为一种有不同价格的有限资源,机器人变成了一个更聪明的导航者,它通过高效地解决问题,而不是靠瞎猜来完成任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →