OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
OptiSight 是一个结合了视觉-语言模型推理与确定性视觉伺服的混合框架,通过利用 Grounded-SAM 进行目标定位并利用相机几何进行控制,且无需密集建图,从而在 8GB 显存预算内实现高效、零样本的室内自主导航。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在房间里移动是人类无需思考就能完成的行为,但对于机器而言,这是一个由两种截然不同的复杂谜题组成的难题。一部分是感知与理解:知道墙上的一个深色长方形是门,或者知道一堆箱子挡住了去路。另一部分是移动:精确计算轮子需要转动多少角度,才能避开一把椅子而不发生碰撞。多年来,机器人要么擅长其中之一,要么两者兼顾却难以同时达到平衡。有些系统非常擅长绘制地图并避开障碍物,但它们无法理解像“去找那把红椅子”这样的指令。另一些系统虽然能理解语言并识别物体,但在实时安全移动方面往往反应过慢或动作笨拙。研究人员面临的挑战在于,如何构建一个既能对所见之物进行推理,又能像人类手部那样精准移动的机器人,同时还要能在足够小的计算机上运行,且该计算机能安装在机器人的背部。
一组研究人员开发了一种名为 OptiSight 的新系统,旨在弥合这一差距。他们并没有试图让一个单一的计算机程序同时完成所有工作,而是将任务拆分为两个协同工作的不同角色。第一个角色是“思考者”,一个强大的人工智能,它观察摄像头的视野,确定那里有哪些物体以及机器人需要前往何处。第二个角色是“驾驶员”,一套快速、简单的规则,负责接收“思考者”的决策并立即引导机器人转向。其核心创新在于,“思考者”不需要持续不断地发言。它只在机器人到达重大决策点时介入,例如当机器人需要寻找新目标或迷路时。一旦路径清晰,“驾驶员”就会接管,在无需再次寻求帮助的情况下,平稳地引导机器人前往目的地。这种方法使机器人能够理解复杂的指令(如“走出房间”),同时能在标准便携式计算机的内存限制内,快速且安全地移动。
为了测试这一想法,研究人员将该系统置于一个名为 AI Habitat 的详细虚拟世界中,该环境模拟了真实的室内环境,包含家具、墙壁和障碍物。他们给机器人布置了一个简单但困难的任务:离开一个房间。他们在二十四种不同的场景下进行了这项测试,场景范围从空旷的房间到充满干扰物体、反射表面和狭窄通道的空间。在某些测试中,机器人必须绕过单个障碍物;而在另一些测试中,它必须区分两个看起来相似的门口,或者在视野被部分遮挡时寻找路径。该系统使用一种特定类型的人工智能来识别物体,并使用一套独立的几何系统来计算所需的精确角度。机器人被编程为循环执行以下操作:检查周围环境、决定去向,然后执行移动。
结果表明,这种拆分的方法效果显著。在十二个场景中,机器人在至少百分之六十的尝试中成功完成了任务,并且在几种情况下,它甚至每一次都成功了。当机器人成功时,它在整个旅程中通常只需向“思考者”寻求一两次帮助。这证明了该系统并不需要通过不断重新评估场景来推进。相反,它可以依靠其几何“驾驶员”来处理连续的运动。少数失败的情况通常是因为机器人离障碍物太近而不得不停下来恢复,或者是由于环境过于混乱导致初始计划失效。即使在这些困难的情况下,该系统也表现出能够识别问题并尝试重新开始,而不是盲目地撞上去。
这项发现的意义在于它如何在智能与速度之间取得平衡。研究人员发现,通过将沉重、缓慢思考的人工智能限制在最关键的时刻,他们可以让机器人保持实时移动。该系统在 8 GB 显存的严格限制下运行,这一约束模拟了现实世界中许多机器人所拥有的有限计算能力。这意味着该方法不仅仅是一个适用于强大超级计算机的理论构想,而是一种可以运行在实际机器所携带的小型计算机上的实用方法。实验表明,机器人并不需要每一步都是天才才能发挥作用;它只需要知道何时思考,何时行动。通过将推理与移动分离,OptiSight 为机器人在人类复杂的、不可预测的家居环境中导航提供了一种可靠的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。