← 最新论文
💻 computer science

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

本文介绍了 FOUND-IT,这是一个实时、任务驱动的框架,它利用几何基础模型,在非校准的单目环境中,为不断演变的移动操作任务动态生成具有可调整粒度的分层三维场景图。

原作者: Dominic Maggio, Nicolas Gorlo, Luca Carlone

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Dominic Maggio, Nicolas Gorlo, Luca Carlone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人在房子里导航。如今的大多数机器人就像那些死记硬背地图的学生,且只掌握单一、固定精度的地图。如果它们需要走到厨房,它们能看到整个房间。但如果它们需要转动炉灶上的某个特定旋钮,它们就会陷入困境,因为它们的地图要么太模糊而看不清旋钮,要么太杂乱而无法同时看清整个房间。此外,它们通常还需要昂贵、专用的 3D 摄像头来构建这张地图。

这篇论文介绍了FOUND-IT,这是一个新系统,它充当机器人记忆的“智能、自适应图书管理员”。以下是其工作原理,分解为简单的概念:

1. “变焦镜头”记忆(按需粒度)

将 FOUND-IT 想象成不是一个静态地图,而是一个智能相机镜头,它会根据机器人被要求执行的任务来改变焦点。

  • 问题所在: 传统系统在初次观察房间时就决定了物体的“大小”。它们可能将炉灶视为一个单一的大物体。随后,如果机器人需要转动旋钮,由于地图缩放比例过大,它就无法看到旋钮。
  • FOUND-IT 的解决方案: 它保留原始视频帧的“视觉记忆”,但尚未将它们锁定为特定的物体大小。当机器人接收到任务时,它会瞬间进行放大或缩小。
    • 任务:“去厨房。” -> 系统缩小视野,将整个房间视为一个大区域。
    • 任务:“关掉炉灶。” -> 系统放大视野,识别炉灶上的特定旋钮。
    • 任务:“找到水壶。” -> 系统放大到刚好能看清水壶的程度。
    • 类比: 这就像拥有一个谷歌地图,可以根据你的搜索查询,瞬间在显示整个城市、特定街区或单个街道地址之间切换,而无需每次都重新绘制地图。

2. “独眼”相机(未校准的单目)

大多数先进的机器人需要两个摄像头(立体视觉)或深度传感器(如激光扫描仪)来理解三维空间。这既笨重又昂贵,且难以设置。

  • FOUND-IT 的解决方案: 它使用单个标准摄像头(就像你手机上的那个)和一个强大的 AI“基础模型”(一个已经知道三维空间如何运作的预训练大脑)来推测房间的深度和结构。
  • 类比: 这就像人类可以在黑暗的房间里行走,仅凭一只眼睛观察并利用大脑的经验来知道家具在哪里。FOUND-IT 通过单个摄像头输入,以数学方式实现了这一点。

3. “平面图”生成器(区域层)

为了四处移动,机器人需要知道哪里可以行走(可通行空间)以及哪里不可以(墙壁、桌子)。

  • FOUND-IT 的解决方案: 该系统不是进行复杂的几何计算,而是在主相机大脑上添加了一个特殊的“头部”(一个小型的额外 AI 工具)。该工具查看视频,并立即在地面上绘制出“平面图”,识别出机器人可以行走的瓷砖区域。
  • 类比: 想象一个机器人看着一段凌乱客厅的视频。当其他系统还在努力分辨地板在哪里结束、地毯从哪里开始时,FOUND-IT 会立即用绿色高亮显示可行走的地板瓷砖,忽略墙壁和家具,为机器人创建一条安全路径。

4. “智能分组”系统(区域)

机器人通常需要理解诸如“厨房”或“走廊”这样的概念,这些不仅仅是单个物体,而是地点的集合。

  • FOUND-IT 的解决方案: 它根据机器人的请求,将找到的“地板瓷砖”分组为区域。如果机器人询问“厨房”,系统会收集所有看起来像厨房的地板瓷砖并将它们连接起来。
  • 类比: 如果你问一个人“厨房在哪里?”,他们可能会指向一个特定区域。如果你问“游戏区在哪里?”,他们可能会指向同一房间的不同角落。FOUND-IT 动态地执行此操作,仅在有人询问时才将地板瓷砖分组为“房间”,而不是事先将整个房子强制划分为固定的房间。

5. “代理”(大脑)

该系统包含一个与机器人对话的 AI 代理(数字助手)。

  • 工作原理: 当机器人收到指令(例如“把毛巾拿给我”)时,该代理不仅仅是搜索预制的列表。它会边走边主动构建地图,寻找毛巾,检查它们是否存在;如果不存在,它会意识到毛巾不在那里,并可能转而寻找其他物体。
  • 类比: 这就像一名侦探,不仅仅是阅读档案;他们会主动调查现场,寻找与手头特定案件(任务)相关的线索(物体),并实时更新他们的心理地图。

他们实际证明了什么

作者通过多种方式测试了该系统,以证明其有效性:

  • 准确性: 在标准基准测试中,与以往方法相比,它在寻找物体和理解任务方面的表现显著更好(提升了 79%)。
  • 速度: 它能在机器人(具体为"Spot"机器狗)上实时运行,使用强大的机载计算机(Jetson Thor)。
  • 现实世界应用: 他们成功利用房地产中介在 YouTube 上拍摄的随意视频构建了这些 3D 地图,证明该系统不仅适用于完美的实验室数据,也能处理来自互联网的杂乱、非受控视频。

总结: FOUND-IT 是一个系统,它允许机器人仅使用单个摄像头构建房间的 3D 地图,然后瞬间放大或缩小,以看清完成工作所需的确切内容,无论是导航走廊还是转动微小的旋钮。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →