A Scene Language Model for Open-Vocabulary Scene Mapping
该论文介绍了 SceneLM,这是一种视觉-语言模型,它通过将持久的、开放词汇的 3D 场景图维护为紧凑的结构化文本列表,实现了与传统制图系统相比显著降低的内存占用,并取得了具有竞争力的定位和检索性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在世界上移动的机器人需要一种记住它们所见事物的手段。为了在房间里导航、打开门或递给人类一个杯子,机器必须建立一个关于其周围环境的精神地图,并且即使在它转身离开后,该地图依然能够持续存在。多年来,工程师们一直使用复杂的多步骤系统来构建这些地图。这些系统检测物体,计算它们在三维空间中的位置,然后存储大量的视觉数据——例如每个表面的详细快照或数学指纹——以保持地图随时间的一致性。虽然这些方法很有效,但它们非常消耗内存,并且需要专门的软件将不同的视图缝合在一起。研究人员一直在思考的问题是,是否可以通过一个单一的智能系统,使用一种更简单的信息存储方式,来独立完成这项全部工作。
一个研究小组开发了一种名为 SceneLM 的新方法,试图用一个仅使用文本来维护场景地图的单一模型,来取代这些沉重的多部分系统。该系统不再存储复杂的视觉数据或特征图,而是保留一份持久的物体列表,包括它们的地点和简短的书面描述。当机器人看到一张新图像时,模型会读取其当前的文本列表并决定如何操作:它会添加刚刚发现的新物体,修改它已知物体的细节,或者删除被错误添加或已不再存在的项目。该系统通过学习数百万张由其他人工智能工具自动标注的图像来学习执行这些更新,创建了一个不需要人类手动绘制 3D 地图的训练流水线。
研究人员发现,这种纯文本的方法效果出奇地好。在涉及基于语言的搜索和导航任务的测试中,该模型的表现与依赖于专用感知和几何模块的现有系统一样好,甚至更好。更重要的是,存储场景所需的内存比传统系统减少了六到十二倍。由于这种表示法非常紧凑,团队能够将该模型运行在连接在四足机器人上的小型计算机上,使其能够实时绘制现实世界环境的地图。机器人成功识别并记录了诸如水壶、垃圾桶和灯开关之类的物体,并在在房间中移动时纠正了自己的错误。
这一成功表明,通常用于维护 3D 地图的复杂工程步骤可以直接通过视觉语言模型进行学习。该系统不仅识别物体,还学习了地图维护的逻辑,理解何时保留条目、何时完善条目以及何时丢弃条目。训练过程依赖于一个自动化的流水线,该流水线从图像中生成高质量的标签,过滤掉糟糕的描述,并创建一个足够大的数据集,从而在没有人工干预的情况下教会模型这些行为。虽然该系统处理每一帧的速度比旧方法慢,但其代价是大幅降低了内存占用,并采用了一种统一的方法,将感知和内存更新整合在一个步骤中完成。
实验表明,该模型可以处理移动机器人的复杂现实情况。在一次使用配备了摄像头和小型车载计算机的四足机器人的现实世界测试中,该系统绘制了三个不同的环境,包括室内房间和户外区域。它仅在机器人移动特定距离时处理图像,以确保能够跟上硬件的速度。最终生成的地图包含了正确的物体及其准确的位置,证明了基于文本的表示法足以用于导航和物体检索。研究人员指出,虽然当前版本运行需要大量的计算能力,但将 3D 场景压缩为简单的单词列表的能力,为未来更高效、更强大的机器人开启了大门。
通过证明单一模型可以通过简单的文本操作来管理持久的场景状态,这项工作挑战了“复杂的制图需要复杂的独立组件”这一观点。结果表明,随着视觉语言模型变得更加强大,它们可能会自然地吸收目前由专门软件处理的场景维护任务。该研究并不声称已经解决了机器人领域的每一个问题,但它提供了强有力的证据,证明轻量级的、基于文本的记忆是替代过去沉重的、富含特征的地图的一种可行且强大的替代方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。