SC-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments
本文提出了 SC-WM,一种自纠错世界模型框架,该框架通过利用用于状态级规划细化的内部反馈以及用于模型级修正的条件世界感知自适应,增强了连续环境中的视觉语言导航能力,从而提升了导航的鲁棒性与泛化性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为一名隐形巨型迷宫的导游。这个机器人有一个摄像头,并且能听到你的声音,但它无法一次看到完整的地图。它只能看到其镜头正前方的世界。这就是**视觉-语言导航(Vision-and-Language Navigation, VLN)**的世界。机器人必须听从像“走过红色沙发,在走廊处左转,然后在台灯处停下”这样的指令,并实际移动身体去寻找那个台灯。棘手的部分在于,机器人是“部分可观测”的,这意味着它就像是在用手电筒在黑暗的房子里行走;你只能看到一个小圆圈的光亮,你必须记住自己去过哪里,才能知道自己身在何处。
如今大多数机器人尝试通过制定一个计划并逐步执行来解决这个问题,而不会回头观察自己是否仍处于正轨。这就像开车时盯着纸质地图看,拒绝看向挡风玻璃,直到撞到墙为止。如果机器人在早期犯了一个微小的错误——比如向左转得稍微多了点——它会一直朝着错误的方向走下去,误差会不断累积,直到它彻底迷失方向。这篇论文介绍了一种新的机器人思考方式:与其盲目行走,不如让它们学习如何“白日梦”下一步会发生什么,检查那个白日梦是否符合它们当下的感觉,并在迈出第一步之前就纠正航向。
会通过“白日梦”避免迷路的机器人
认识一下 SC2-WM,一种专为这些复杂的连续 3D 世界设计的全新机器人大脑。作者注意到,大多数机器人就像是考试时不检查答案的学生。它们读完指令,做出猜测,然后行动。如果猜错了,它们直到撞到墙或被困住时才会意识到。研究人员希望给机器人提供“第二双眼睛”,这双眼睛存在于它们的脑海之中。
把 SC2-WM 想象成一个拥有超能力的机器人:预见力。在机器人真正迈开腿之前,它会停顿并问自己:“如果我走这一步,一秒钟后的世界会是什么样子?”它创造了一部关于未来的“心理电影”。这被称为“世界模型(World Model)”。这就像一位棋手,不仅是在移动棋子,还在想象对手的下一步动作以及棋盘随后的状态。
奇迹就在这里发生。机器人将它的“未来心理电影”与当前的现实进行对比。
- “状态级”修正: 想象你在走路,你白日梦应该会看到一个厨房,但你的眼睛告诉你你还处在卧室里。你的大脑会说:“等等,有些不对劲!”SC2-WM 正是这样做的。它察觉到了预测与当前状态之间的不匹配。然后,它会在迈出步伐之前,轻轻地调整其内部地图以修复错误。这就像一个 GPS,意识到你错过了一个转弯,并在你开进错误的街道之前立即重新计算路线。
- “模型级”修正: 有时,机器人的“白日梦”能力对于它从未见过的奇怪新房间可能不够好。也许墙壁颜色不同,或者家具摆放得很奇怪。在这种情况下,机器人会意识到:“我的内部地图过时了!”然后它会触发一种特殊的“适应模式”。它会快速更新自己的大脑规则,以更好地理解这个特定的新环境。这就像一个学生意识到他们的学习指南不适用于这次特定的考试,于是他们迅速改写笔记以匹配新的问题。
论文指出,依赖外部奖励(比如只在最后才由人类说“做得好!”)反应太慢且过于稀少。相反,SC2-WM 使用内部反馈。它倾听自己的“直觉”(即预期与所见之间的差异),从而实现实时自我纠正。
实验结果显示
研究人员在两个主要的数字世界中测试了这个会“白日梦”的机器人:R2R-CE 和 RxR-CE。这些是充满了家具、走廊和复杂指令的复杂 3D 环境。他们将 SC2-WM 与其他不具备这种自我纠错能力的顶尖机器人进行了对比。
结果非常令人振奋。在 R2R-CE 数据集中,当机器人需要导航未见过的房间(如它从未造访过的新房子)时,与之前的最佳方法相比,SC2-WM 将其成功率 (SR) 提高了 7.1%,并将路径长度加权成功率 (SPL) 提高了近 7.8%。它还走得更短,平均比其他机器人少走 5 米 的距离,这意味着它不会到处乱逛。
在更难的 RxR-CE 数据集(拥有更长、更复杂的指令)中,机器人的成功率提高了 9.1%,路径效率提高了 7.1%。研究人员还在真实的物理机器人——一台带有摄像头的 Unit üzere GO2 四足机器人(类似四条腿的狗形机器人)上测试了它。在现实世界中,SC2-WM 达到了 85% 的成功率,击败了标准机器人的 70%。这表明“白日梦”技巧不仅在计算机模拟中有效,在杂乱的现实房间中也同样适用。
这为什么很重要
论文指出,通过赋予机器人检查其内部预测的能力,我们可以让它们变得更加可靠。SC2-WM 不再是那些只会死板执行剧本并在情况稍有变动时就失败的僵化机器,它更像是一个谨慎的探险家,不断检查自己的指南针。它不需要人类告诉它错了;它通过意识到自己的“白日梦”与现实不符来发现错误。
作者谨慎地指出,这并不是解决一切问题的“灵丹妙药”。他们发现,当机器人拥有良好的近期步骤记忆(大约回溯 4 步)并且仅在确实需要时才更新大脑规则时,效果最好。他们还指出,虽然其他一些方法使用庞大沉重的 AI 模型,但 SC2-WM 是“轻量级”的,可以在单个显卡上高效运行。这意味着它最终可以被安装在小型现实世界的机器人上,让它们在无需云端超级计算机的情况下,也能在我们的家中进行导航。
简而言之,SC2-WM 教会了机器人如何变得更有“自我意识”。通过让它们“思考未来”并在错误发生前进行纠正,我们或许终于能得到能够应对复杂、混乱世界的机器人,而不会在第一个走廊就迷失方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。