LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
LightNav-0 是一个紧凑的通用型具身导航模型,它利用统一的标记接口来激发并对齐预训练视觉语言模型的空间智能与机器人控制,从而在无需任务特定预测头的情况下,在多种任务、环境和具身形态中实现了最先进的性能和零样本泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人在移动方面一直难以达到人类那样的自如程度。人类可以走进一个房间,发现一把蓝色的椅子,并在听取口头指令的同时绕过桌子,而机器人看到的往往只是像素和声音的混乱堆砌。为了弥补这一差距,科学家们多年来一直致力于构建专门的系统,将视觉、思考和移动视为独立的工作。软件的一部分可能负责识别物体,另一部分可能负责绘制地图,第三部分则决定转向的方向。这种方法在受控环境中表现良好,但当机器人遇到新房间、不同类型的机器或复杂的指令时,往往会失效。挑战在于创建一个能够同时理解场景、推理路径并控制身体到达目的地的统一“大脑”。
一组研究人员现在推出了一种名为 LightNav-0 的新系统,试图通过教机器人像人类一样思考来解决这个问题:即通过观察图像、指向目标位置,然后进行移动。研究人员并没有为每项任务构建单独的工具,而是采用了一个已经理解语言和图像的大型预训练计算机模型,并教会它如何导航。这个模型不需要为每个新机器人或每个新房间重新编程。它只需观察所见,聆听指令,然后决定路径。其结果是一个紧凑的系统,能够遵循指令、寻找特定物体,甚至追踪移动目标,同时可以在各种类型的机器(从轮式小车到四足机器人)上运行,且无需任何特殊调整。
该系统的核心是一种将机器人的思维转化为行动的巧妙方式。想象一下,机器人正在看着显示一条走廊的屏幕。当它听到指令“走到石建筑旁边的蓝色食物菜单牌处”时,它并不会立即开始转动轮子。首先,它利用内部推理在屏幕上的两个特定位置进行“指向”。一个点指示一个安全的移动方向,比如一片开阔的地面;另一个点则识别出实际的目标,即那个蓝色标牌。这种“指向”的行为充当了机器人大脑与身体之间清晰的共享语言。一旦确定了这些点,机器人就会预测一段包含十个步骤的短路径以到达该位置。随后,它执行这条路径,观察新的视野,并重复这一过程。通过将旅程分解为这些细小的、经过推理的步骤,机器人可以在复杂环境中行驶而不至于迷失或困惑。
为了教会机器人这项技能,研究人员不仅仅是给它展示了一些例子。他们创建了一个庞大的训练库,其中包含超过 2,000 个不同的场景和超过 4,000 小时的导航数据。这个库涵盖了寻找物体、跟随人类以及在室内外空间中移动的指令。训练过程分阶段进行。首先,模型被教会理解空间关系,并能准确地指向图像中的物体和位置。接着,它被教会将这种指向能力与导航所需的实际移动指令相结合。最后,系统通过试错过程进行了精炼,使其学会纠正自身的错误并随着时间的推移改进路径规划。这种严格的训练使模型具备了泛化能力,这意味着它可以将从训练数据中学到的知识应用到从未见过的全新情境中。
这项工作的成果意义重大,因为它们表明,一个相对较小的统一计算机模型,其表现可以超越依赖许多不同专业化部分的庞大且复杂的系统。在十个不同模拟环境的测试中,即使在只能使用单摄像头视角且无法获取深度传感器或预制地图的情况下,该新系统在遵循指令和寻找物体方面也取得了最高的成功率。它在室内房间、室外区域,甚至是在视觉风格完全不同的游戏世界中都表现出色。或许更令人印象深刻的是,研究人员在四种截然不同的物理机器人上测试了相同的软件:人形机器人、四足机器人、无人机和轮式车辆。在没有更改一行代码或重新训练模型的情况下,该系统成功引导了所有四种类型的机器完成了现实世界的任务,例如跟随一个人或寻找特定物体。
这种方法挑战了“机器人需要为每个新工作或每种身体类型配备独特大脑”的旧观念。通过使用一种让机器人指向目标并规划短路径的统一方法,研究人员证明了单个紧凑的系统可以处理各种各样的导航任务。该系统并不依赖于魔法或复杂的隐藏计算;它只是学会了观察世界、理解指令并指明前进的方向。虽然这项工作主要是在模拟环境和受控现实环境中进行的测试,但这种跨不同机器人和环境的迁移能力,预示着未来机器人可以在无需大量重新编程的情况下,被部署到新地点并承担新任务。LightNav-0 的成功表明,通往更具能力和适应性的机器人的路径,或许不在于构建更大、更专业的机器,而在于教会它们像人类每天使用那样,以简单和灵活的方式去观察、思考并指向前方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。