← 最新论文
💻 computer science

IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation

本文介绍了 IMPRINT,这是一个通过利用网络来源的图像来丰富基于文本的查询,从而增强语义地图定位并提升长尾目标导航性能的零样本框架,同时提出了 HSSD-rare 基准测试,并指出下游检测质量是导致定位增益难以转化为导航成功率的关键瓶颈。

原作者: Jelin Raphael Akkara, Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jelin Raphael Akkara, Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为一个巨大且凌乱房屋中的得力管家。为了实现这一目标,机器人需要一个关于世界的心理地图,但它不仅仅是知道“椅子”在哪里,而是需要找到一个非常具体的“红色天鹅绒扶手椅”或角落里的“奈斯派索咖啡机”。这个领域被称为具身智能(Embodied AI),即机器人学习如何在现实世界中移动和行动。它们使用的一个关键技巧是语义地图构建(Semantic Mapping):机器人构建一张数字地图,其中每个物体都被贴上了名称标签,就像一个巨大的图书馆目录。为了在没有预先被告知每一个物品的情况下找到东西,机器人使用视觉语言模型(Vision-Language Models)。把它们想象成读过整个互联网的超级智能词典;它们可以理解“沙发”这个词和一张沙发的图片是同一回事,即使机器人以前从未见过那张特定的沙发。这非常令人兴奋,因为这意味着理论上机器人只要通过理解语言,就能找到你要求的任何东西,从“勺子”到“稀有的复古灯具”。

然而,这里有一个问题。虽然这些机器人在寻找“椅子”或“桌子”等常见物品方面表现出色,但当你要求寻找特定物品时,比如“蓝色陶瓷杯”而不是“白色陶瓷杯”,它们往往会感到困惑。仅仅靠文本描述不足以让它们区分开来。这就是一篇名为 IMPRINT 的新论文发挥作用的地方。研究人员意识到,如果人类想要寻找某个特定的、稀有的物体,他们不会只说出名字,而是会先查找一张该物体的图片。因此,他们为机器人构建了一个完全一样的系统。

IMPRINT 是一个“即插即用”的工具,这意味着你可以将其添加到现有的机器人导航系统中,而无需从头开始重建整个机器人。它的工作原理是:当机器人被要求寻找某个特定物体时,它不再仅仅使用文本名称,而是去互联网上抓取几张与该物体相关的图片,并将其展示给机器人的“大脑”。然后,机器人将这些图片与它脑海中的房间地图进行对比。这就像是给了机器人一张带有照片的“通缉令”,而不仅仅是一份描述。随后,该系统会高亮显示地图上与照片看起来最相似的位置,帮助机器人精准定位目标位置。

团队通过两种方式测试了这个想法。首先,他们检查了添加图片是否能帮助机器人仅仅在地图上找到该物体(就像在纸上玩寻宝游戏)。他们发现,添加图片后,机器人变得更擅长发现正确的物品,尤其是对于那些棘手的、长尾分布的物体(即稀有或非常具体的物体)。例如,在针对这些难找的子类别进行测试的 HSSD-rare 测试中,使用图像相比仅使用文本,显著提高了机器人的成功率。

其次,他们测试了这种更好的地图阅读能力是否真的能帮助机器人在实时模拟中进行导航。结果有些复杂,这导致了一个重要的发现。虽然机器人确实能在地图上更清楚地“看到”物体,但有时它仍然无法真正到达那里。研究人员发现,瓶颈不再是地图,而是机器人在靠近物体时利用摄像头实际进行“检测”的能力。换句话说,IMPRINT 给机器人提供了一个极佳的 GPS 坐标,但如果机器人的眼睛很模糊,它仍然无法抓到奖品。当他们将 IMPRINT 与更敏锐的“眼睛”(更好的物体检测器)结合使用时,导航成功率大幅提升。

该论文还引入了一种新的测试,称为 HSSD-rare,这是一个充满了数百种特定、稀有物体类型的数字游乐场,旨在挑战机器人区分非常相似事物的能力。他们发现,虽然 IMPRINT 在处理常见物品时表现良好,但真正的魔力发生在将其与更好的稀有物品检测工具结合使用时。作者建议,要真正掌握寻找稀有物品的艺术,我们需要同时改进“搜索引擎”(地图)和“眼睛”(检测器)。他们并没有声称已经完全解决了这个问题,但他们展示了一条清晰的前进路径:给机器人一张照片,并确保它的视觉足够敏锐,以便在到达时能识别出它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →