← 最新论文
💻 computer science

ODG-NoMaD: Overhead-Camera Direction-Guided NoMaD

ODG-NoMaD 通过将由顶置摄像头衍生的全局方向引导集成到其基于扩散的探索过程中,增强了 NoMaD 的视觉导航策略,在无需重新训练策略的情况下,显著减少了目标距离并确保了在未知环境中的无碰撞导航。

原作者: Blossom Treesa Bastian, Keerthi S. Shetty, Manish Kolachalam, Rani Malhotra, Ashish Dutta

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Blossom Treesa Bastian, Keerthi S. Shetty, Manish Kolachalam, Rani Malhotra, Ashish Dutta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人被派往一个它从未见过的房间,任务是寻找地板上的一个特定位置。机器人没有地图,没有指令,也没有人引导它。它只能通过单摄像头看到正前方的景象。在这种情况下,一个被训练用于探索的机器人,其行为就像一个在陌生城市中漫游却没有任何指南针的人:它向前移动,撞到墙时转向,偶尔会回到已经访问过的地方。它可能会靠纯粹的运气偶然发现目标,但更多时候,它是在盲目地徘徊,困在房间的局部角落里,无法把握前往目标所需的宏观全局图景。这就是自主导航在未知空间中的核心挑战:如何既能赋予机器人规避眼前障碍物的局部反射能力,又能提供到达远端目的地所需的全局意识。

研究人员已经开发出了强大的学习型系统,让机器人能够通过观察数千个示例来学习如何移动,而不是通过严格的规则进行编程。其中一种被称为 NoMaD 的系统在两方面表现出色:一是当展示一张目标图片时,它能导航至特定目标;二是在没有给定目标时,它能探索未知区域。然而,在其探索模式下,该系统缺乏方向感。它会生成许多可能的路径,但由于缺乏全局引导,它无法判断哪个方向通向目标。它是反应式的,即它响应当前所见,但它并不具备战略性。为了解决这个问题,来自 Infosys 和印度理工学院坎普尔分校(IIT Kanpur)的研究团队创造了一种新方法,将机器人的学习移动能力与一次性的俯视图结合起来。

这种被称为 ODG-NoMaD 的新方法,通过在机器人开始移动之前,让它从一个安装在天花板上的摄像头中瞥一眼整个工作空间来发挥作用。这个顶置摄像头拍摄一张深度图像(用于测量物体距离),并利用它构建一个房间的俯视图。这张地图显示了墙壁的位置、家具的摆放以及开阔地面的分布。利用这张地图,计算机规划器可以绘制出一条从机器人起点到目标的安全直线路径。这条路径随后被分解为简单的方向,告诉机器人在任何给定时刻应该向哪个方向行进。关键的创新在于,这种全局方向并不是用来取代机器人自身的决策,而是将其“温柔地注入”到机器人现有的学习模型中,并在运行时生效。机器人仍然使用自己的摄像头来观察地面并避免即时碰撞,但它现在拥有了一个将其拉向正确航向的微妙偏差。

研究人员在模拟办公室环境中测试了该系统,这是一个充满了桌子、椅子和储物箱的空间,类似于现实中的办公场所。他们将这种新方法与未引导的标准版机器人以及另一种试图通过直接指向目标来引导机器人的系统进行了对比。结果显示出了巨大的差异。在没有任何引导的情况下,标准机器人会在大多数尝试中偏离航线并在远离目标的地方停止。然而,新方法成功地引导机器人在每一次试验中都到达了目标,并将平均落后距离缩短了约七倍(相比于未引导版本)。它也比那种直接指向目标的系统表现得更好,因为新方法引导的是一个大致方向,而不是强迫它走向单一的点,这使得它能够保持灵活性和适应性。

或许最重要的发现是该系统如何处理意外情况。在某些测试中,研究人员在创建俯视图和规划路径之后,在房间内放置了新的障碍物。这些障碍物不在地图上,因此机器人无法预知它们的存在。标准的引导式机器人(仅依赖预设路径)会试图直接撞向这些新物体。然而,完整的 ODG-NoMaD 系统使用了第二次实时检查。当机器人移动时,它会使用自带的摄像头扫描正前方的地面。如果它检测到有新障碍物阻挡了规划路径,它会立即计算出一条安全的绕行路径,在保持朝着目标大致方向的同时绕过物体。这使得机器人即使在环境发生变化(在初始地图制作后)的情况下,也能在不碰撞任何物体的前提下到达目标。

这项研究表明,无需重新训练或教授机器人新规则,就可以赋予学习型机器人一种全局方向感。通过简单地添加一次性的俯视图和一种检查即时障碍物的方法,研究人员将一个徘徊的探索者变成了一个有目的的导航者。该系统完全在机器人运行时运作,使用的是预训练模型本身,只是通过一种温柔的全局推力来引导其选择。这为那些需要在动态、未知空间(如灾区或繁忙的仓库)中运行的机器人提供了一条切实可行的路径,因为这些机器人必须能够在寻找目标的同时,安全地应对现实世界中发生的意外变化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →