← 最新论文
🤖 AI

CoFL-S: Spatially Queryable Sector Flow Fields for Local Language-Conditioned Navigation

该论文提出了 CoFL-S,一种通过预测以语言为条件的流场来实现连续轨迹生成的低层级视觉-语言-动作框架,并在一个新的连续时间 Habitat 基准测试以及零样本真实世界部署中,展示了优于现有基准模型的性能。

原作者: Haokun Liu, Zhaoqi Ma, Yicheng Chen, Wentao Zhang, Masaki Kitagawa, Zicen Xiong, Jinjie Li, Moju Zhao

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Haokun Liu, Zhaoqi Ma, Yicheng Chen, Wentao Zhang, Masaki Kitagawa, Zicen Xiong, Jinjie Li, Moju Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人仅通过语音指令(如“走过右侧的第一扇门”)来在房屋中导航。目前大多数机器人就像是只会死记硬背严格步骤的学生:“向前走一步,左转,停止。”如果地板略有不同,或者机器人的转向稍稍晚了一点,它们就会感到困惑并发生碰撞。

这篇论文介绍了一种教机器人如何移动的新方法:CoFL-S。它不再是给机器人一份死板的步骤清单,而是根据它们所见所闻,赋予它们一张活生生的、会呼吸的“推力”与“拉力”地图

以下是其工作原理的简单拆解,使用了日常类比:

1. 旧方法 vs. 新方法

  • 旧方法(动作标记/块 - Action Tokens/Chunks): 想象一个机器人只知道说“我现在要左转”或“我要向前走3秒”。这就像一个司机只知道在特定时刻踩油门或踩刹车。如果路面意外弯曲,司机就会陷入困境,因为他们只规划了下一秒的情况。
  • 新方法 (CoFL-S): 想象机器人不仅仅是在规划一个步骤,它还在面前的地板上创建了一张风向图
    • 如果指令是“走到椅子那里”,地图上就会有一股微风吹向椅子。
    • 如果有一堵墙,地图上就会有一股强风将机器人从墙边推开
    • 机器人不只是选择一个方向;它能感受到周围各处的风。如果它稍微偏离了航线,这种“风”会自动将其推回正轨,而无需新的指令。

2. 它如何观察世界

机器人使用摄像头(RGB)和深度传感器(类似于3D眼睛)来观察房间。它还会倾听一段简短的局部指令(例如“绕过沙发”)。

  • “扇区流场”(The Sector Flow Field): 把机器人的视野想象成一个圆饼的切片(扇区)。CoFL-S 在这个切片上绘制了一个彩色的流场。
    • 蓝色箭头可能指向目标。
    • 红色箭头可能指向远离障碍物。
    • 机器人查询这张地图:“如果我站在这里,风往哪个方向吹?”然后它就朝着那个方向移动。

3. 训练机器人

为了教导这个机器人,研究人员并没有仅仅展示一段人走路的完整视频。他们将视频分解成了逐帧的形式。

  • 类比: 想象你在看一部人走向门的电影。研究人员没有只说“他们走向了门”,而是把电影在每一秒钟都暂停下来。他们问道:“在这一秒,如果这个人想要去那扇门,应该受到向哪个方向的推力?”
  • 他们创建了数百万个这样的“微时刻”,将机器人的视野、简短的指令以及该瞬间正确的“风向图”进行配对。这教会了机器人不仅要理解去哪里,还要理解如何平滑地绕过家具移动。

4. 结果:模拟与现实

研究人员通过两种方式测试了该系统:

  • 在计算机中(Habitat): 他们将机器人置于虚拟世界中。他们将 CoFL-S 与使用旧有的“步进式”方法的机器人进行了对比。CoFL-S 始终胜出。它在到达目标方面表现更好,动作更平滑,且更不容易卡住。无论机器人是每秒检查 2 次还是 10 次地图,它都能表现良好。
  • 在现实世界中: 他们将机器人在计算机中训练好的模型拿出来,放入真实的建筑(办公室和户外)中,而没有进行任何新的教学。
    • 结果: 机器人成功地在真实的走廊中导航,避开了真实的椅子,并遵循了人类的指令。
    • 为什么有效: “风向图”的方法非常鲁棒(稳健)。即使机器人在处理图像时存在轻微延迟(这是真实计算机中的常见问题),地图仍然能提供一条安全的路径。传统的“步进式”机器人往往会出现震荡(来回摇摆)或撞到墙上,因为它们无法足够快地做出调整。

核心总结

CoFL-S 将机器人的大脑从一个步数计数器转变为一个感知者。它不再记忆僵化的动作序列,而是学会了感知环境的“流动”。这使得它能够平滑且安全地导航,即使在情况并非完全符合预期时也是如此,这让它在现实世界中遵循语言指令的能力得到了极大的提升。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →