← 最新论文
💻 computer science

GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates

本文介绍了 GroundControl,这是一种轨迹一致的不确定性估计器,它通过对偏离目标导向距离动力学的行为进行建模,来预测视觉语言智能体的导航失败,并通过一种新的选择性风险-覆盖导航(SRCN)协议,在按失败或低效程度对片段进行排序方面,展示了优于现有基准模型的卓越性能。

原作者: Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观: “迷路的游客”问题

想象一下,你正在派一个机器人(一个“视觉-语言智能体”)去参加一场寻宝游戏。你给了它一张地图和一条语音指令:“去客厅里的那把红椅子那里。”

这个机器人很聪明。它能看到房间并理解你的话。然而,有时它会感到困惑。它可能会原地转圈,或者盯着一把假椅子发呆,或者朝着错误的方向游荡。

问题在于,目前的机器人并不擅长承认自己迷路了。 即使它们每一步都在走弯路,它们也可能对自己的每一步都表现得非常有信心。它们直到电量耗尽或时间结束时,才会意识到自己失败了。

GroundControl 是一个全新的“安全监控器”,旨在这些失败发生期间就识别出它们,而不是等到机器人撞车之后。


GroundControl 如何工作: “速度计”类比

GroundControl 不再询问机器人:“你对这特定的某一步感到困惑吗?”(这是旧方法所做的),而是询问:“你的整个旅程看起来合理吗?”

把机器人的旅程想象成一次前往目的地的汽车旅行。

  • 目标: 红椅子。
  • 信号: 到达椅子的距离。

在一次完美的旅行中,到目标的距离应该平稳且稳定地减少,就像汽车在笔直的高速公路上行驶一样。

GroundControl 使用了一个 卡尔曼滤波器(Kalman Filter)(一种高级数学工具)来充当一个 预测性速度计。它会预测:“如果你正朝着目标行驶,你的距离应该每秒减少 X 量。”

如果机器人开始做出奇怪的行为,速度计就会发出警报:

  1. 振荡(Oscillation): 机器人在来回行驶(距离忽增忽减)。
  2. 停滞(Stagnation): 机器人堵在了车流中(距离没有变化)。
  3. 绕路(Detours): 机器人在绕一个大圈行驶(距离减少得不够快)。

GroundControl 根据机器人的实际路径与这条平滑、可预测的直线之间的偏差程度,计算出一个 “困惑度得分”(Confusion Score)。如果得分变高,意味着机器人的行为在几何逻辑上是不一致的——即使它觉得自己做得很好,它也很可能正在失败。

得分的组成部分

GroundControl 不仅仅观察速度计;它还会查看整份驾驶报告:

  • 数学逻辑(卡尔曼滤波器): 距离是否按预期发生了变化?
  • 进度: 我们是否真的向目标靠近了?
  • 单调性: 距离是一直在下降,还是忽高忽低?
  • 效率: 机器人走的是直线,还是在四处游荡?
  • 摇摆(Wobble): 机器人是否不断地反复左右转向?

它将所有这些因素结合成一个数字。数字越低,表示“航行平稳”;数字越高,表示“我们正在失控”。

他们是如何测试的:“选择性风险”游戏

为了证明其系统的有效性,研究人员发明了一种新的测试方法,称为 SRCN(选择性风险覆盖导航)。

想象一位老师正在给 100 名学生(机器人任务序列)评分。

  • 旧方法: 老师等到最后才看谁通过了,谁失败了。
  • GroundControl 的方式: 老师在测试过程中观察“困惑度得分”。
    • 如果某个学生的得分过高,老师会说:“停!你要失败了。”
    • 老师接着检查:“我是否及时叫停了那些注定失败的学生?”

如果老师能及早叫停失败的学生,同时让成功的学生继续前进,这就是 完美得分。论文表明,GroundControl 在这方面表现得极其出色。它预测失败的能力几乎可以媲美“魔法水晶球”(他们称之为“先知/Oracle”)。

结果:为什么这很重要

研究人员在三种不同的“大脑”(AI 模型:GPT-4o, GPT-5-mini, 和 Gemini-1.5-Flash)以及 300 个不同的导航任务上测试了该系统。

  • 胜出者: GroundControl 始终能最先发现失败的机器人。它比其他仅观察机器人对“下一步动作”是否感到不确定(Uncertainty)的方法要好得多。机器人可能非常确定自己在向左转,但即便向左转是导致撞车的错误动作,旧方法也往往无法察觉。
  • 失败者: 旧方法(例如检查机器人对下一步动作是否感到不确定)经常会错过失败。机器人可以对自己的转向非常笃定,即便这个转向会导致失败。
  • 长期表现: GroundControl 在处理那些错误会随时间累积的长距离、高难度任务时,表现尤为出色。

总结

GroundControl 就像是导航机器人的副驾驶。它不再问:“你确定这一步转弯吗?”而是问:“你的整个路径看起来像是一条通往目标的直线吗?”

如果路径看起来摇摆不定、停滞不前或是在绕圈,GroundControl 就会拉响警报。这使得系统能够在耗尽时间之前就意识到自己正在失败,从而让机器人更加安全、可靠。

核心要点: 成功不仅仅在于每一步都做出正确的决策,更在于确保整个旅程都在正确的方向上移动。GroundControl 观察的是整个旅程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →