← 最新论文
💻 computer science

RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments

RADIO-ViPE 是一种在线、紧密耦合的多模态 SLAM 系统,它通过直接在原始单目 RGB 视频上运行,无需校准输入、深度传感器或先前的位姿初始化,即可在动态环境中实现几何感知且支持开放词汇的语义定位。

原作者: Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Sergey Kolyubin

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Sergey Kolyubin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正与一位朋友穿过一个繁忙且不断变化的房间。你想要构建一张房间的心理地图,这张地图不仅要知道墙壁和椅子在哪里,还要理解它们“是什么”(例如,“那是一把红色的椅子”,“那是一个咖啡桌”),并能回答诸如“蓝色的马克杯在哪里?”这样的问题。

现在,想象在以下条件下完成这一任务:

  1. 没有人给你蓝图:你不知道你的眼睛(相机)是如何构成的,也不知道物体距离你有多远。
  2. 房间一片混乱:人们来来往往,有人刚刚把沙发从角落搬到了房间中央。
  3. 你必须实时完成:你不能停下来思考数小时;你必须一边移动一边持续构建地图。

这正是 RADIO-ViPE 所做的。它是一个机器人的“大脑”,能够从简单的视频相机中构建世界的三维地图,利用自然语言理解物体是什么,并忽略移动物体带来的混乱。

以下是其工作原理,通过简单的类比进行分解:

1. “魔法眼镜”(无需校准)

大多数机器人系统就像是一个人在戴上完美贴合的眼镜之前无法看清东西。如果眼镜稍有偏差,机器人就会迷路。RADIO-ViPE 则不同。它戴上一副“智能眼镜”,在环顾四周时能自行确定其形状和焦点。它不需要预先测量的地图或特殊传感器(如深度激光);它只需要一个标准的视频相机。它仅通过观察视频的移动来学习房间的几何结构。

2. “超级智能图书管理员”(开放词汇)

旧的机器人地图就像是一个图书馆,里面的书只标有“椅子 1"、“椅子 2"、“桌子 1"。如果你问“那把坏掉的椅子在哪里”,机器人就不知道你在说什么。

RADIO-ViPE 使用了一位“超级智能图书管理员”(基于称为基础模型的巨型人工智能模型)。这位图书管理员阅读了整个互联网。它不仅仅看到形状;它理解概念。你可以问:“展示那盏复古台灯”,机器人就能确切知道那是什么样子的,即使它以前从未被专门教导过那盏特定的灯。它将你的话语直接连接到地图中的三维物体上。

3. “舞池过滤器”(处理动态环境)

这是该论文最大的技巧。想象一下,你试图给一个房间拍一张集体照,但人们进进出出,有人刚刚重新布置了家具。如果你试图将这些照片拼接在一起,结果将是一团模糊的混乱。

RADIO-ViPE 拥有一个特殊的“舞池过滤器”。它随时间观察房间,并问道:

  • “这个物体是静止的吗?”(像墙壁或固定的桌子)。
  • “这个物体是因为有人走过而移动的吗?”(像一个人)。
  • “这个物体是因为移动了它而移动的吗?”(像有人推了一把的椅子)。

如果系统看到某物以不符合“静态房间”模式的方式移动或变化,它本质上会说:“在构建地图时忽略那个”,从而防止地图被破坏。它使用一种特殊的数学“安全网”(称为自适应鲁棒核)来决定视频的哪些部分是可靠的,哪些只是噪声。

4. “紧密协作的团队”(紧耦合融合)

通常,机器人是分步骤做事的:先确定你在哪里,然后确定物体是什么,最后将它们结合起来。这就像一场接力赛,接力棒可能会掉落。

RADIO-ViPE 更像是一个爵士乐队,所有人同时演奏。它结合了:

  • 几何:物体在三维空间中的位置。
  • 视觉:物体看起来的样子。
  • 语言:物体被称为什么。

它同时调整这三者。如果视觉数据模糊,语言线索有助于修正几何结构。如果几何结构不稳定,视觉数据有助于使其稳定。它们都在实时中相互帮助。

结果:他们证明了什么?

作者主要通过两种方式测试了这个系统:

  1. “移动房间”测试(TUM-RGBD):他们在人们走动且物体移动的房间视频上测试了该系统。RADIO-ViPE 在保持地图准确且不被移动的人搞混方面,表现优于几乎所有其他现有系统。
  2. “搜索引擎”测试(Replica):他们测试了机器人是否能构建地图,然后回答关于该地图的文本问题(例如,“沙发在哪里?”)。即使它没有完美的深度传感器或预先校准的相机,其表现也与那些确实拥有这些昂贵优势的系统几乎一样好。与更复杂、离线的系统相比,它排名前三。

简而言之

RADIO-ViPE 是一个系统,它让机器人能够观看一段原始的、未校准的、混乱且移动的房间视频,并即时构建一张理解英语的三维地图。它忽略移动的人和重新布置的家具以保持地图整洁,允许人类询问“咖啡在哪里?”并获得精确的三维答案,而这一切都不需要昂贵的传感器或预设规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →