← 最新论文
💻 computer science

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

WorldVLN 引入了首个用于空中视觉语言导航的自回归世界动作模型,该模型通过预测短时程世界状态转换来直接解码可执行的航点动作,并采用一种新颖的两阶段训练框架,结合动作感知的 GRPO 方法,在基准测试中实现了卓越性能,并支持零样本真实世界无人机部署。

原作者: Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一架无人机仅凭语音指令在城市或房屋中飞行。你说:“飞到那栋红色的建筑,然后绕着树转圈”,而无人机必须精确计算出如何控制其电机来实现这一动作。

本文介绍了一种训练无人机掌握这项技能的新方法,称为WorldVLN。其工作原理如下,简单解释:

旧方法:“猜测与验证”

目前大多数无人机飞控(AI 模型)的工作原理,就像一个戴着只展示“当前道路”画面的眼罩的人试图开车。它们观察当前图像和指令,然后猜测下一步动作。

  • 问题所在:它们并不真正理解因果关系。它们不知道“如果我现在左转,两秒后就会撞向那堵墙”。它们只是对当下做出反应,这往往在情况变得复杂时导致错误。

新方法:“白日梦无人机”

本文作者认为,要飞得好,无人机必须成为一个白日梦者。在移动之前,它应该想象移动后世界会变成什么样子。

WorldVLN 是一个“世界动作模型”。把它想象成一名飞行员,在做出决定前会闭上眼睛一刹那,预演接下来的几秒飞行,然后决定:“好吧,如果我向前飞,我会看到门;如果我向左飞,我会撞墙。所以,我要向前飞。”

以下是 WorldVLN 执行此过程的逐步流程:

1. “时间旅行”大脑

WorldVLN 不仅仅查看当前的视频流,它还利用一个特殊的大脑(基于视频生成技术)来预测未来

  • 类比:想象你在看电影。普通的 AI 只是观看当前的帧。而 WorldVLN 会暂停电影,并问道:“如果角色从悬崖跳下,接下来的 5 帧会是什么样子?”它会生成一段关于未来场景的短暂、模糊的“梦境”。

2. 将梦境转化为动作

一旦无人机拥有了这个关于未来的“梦境”,它不会只是观看。它会问:“这个梦境是否符合我被要求做的事情?”

  • 如果梦境显示它会撞毁,它就知道这个动作是糟糕的。
  • 如果梦境显示它安全地接近目标,它就将这个梦境转化为实际的电机指令(航点)。
  • 关键区别:它不仅仅是映射“图像 -> 动作”。它映射的是“指令 -> 未来梦境 -> 动作”。

3. “闭环”修正

这是最重要的一部分。在无人机实际执行动作后,它会睁开眼睛,看看真正发生了什么。

  • 类比:这就像一名国际象棋棋手。他们计划一步棋,走出这一步,然后立即用新的现实更新他们脑海中的棋盘,再规划下一步。
  • WorldVLN 将无人机摄像头拍摄的真实新视角反馈给其“做梦”的大脑。这防止了无人机迷路,或犯下随时间推移而越来越严重的错误。

它们是如何训练它的(训练过程)

研究人员并没有让无人机随机飞行。他们采用了一种两步训练法:

  1. 第一步:学生(监督学习):他们向无人机展示了成千上万个人类驾驶无人机的例子。无人机学习观察视频和指令,然后“梦”出接下来几秒的飞行,最后模仿人类的动作。这教会了它世界运动的基本原理。
  2. 第二步:教练(强化学习):在这里,他们引入了一种名为Action-aware GRPO的新方法。
    • 类比:想象一位教练,他不仅仅在比赛结束时说“干得好”或“干得糟”。相反,教练会观察玩家做出的每一个动作。如果玩家做出的某个动作最终导致了胜利,教练会给予重奖。如果某个动作最终导致了撞毁,教练会给予惩罚。
    • 这教会了无人机提前思考:“如果我现在做一个小转弯,它将在未来帮助我到达目标。”

结果

研究人员在室内和室外无人机基准测试中测试了该方法。

  • 得分:WorldVLN 以显著优势击败了所有之前的“猜测与验证”模型(飞行成功率提高了 12% 以上)。
  • 现实世界测试:他们将这架在计算机模拟中训练过的无人机带到现实世界中飞行,无需任何额外训练。它成功地在室内房间和室外区域遵循了诸如“飞到屋顶”或“绕着椅子转圈”等指令。

总结

WorldVLN 是一个不仅仅对当前所见做出反应的无人机飞控。它会想象接下来会发生什么,检查该未来是否良好,然后采取行动。如果它做错了,它会从真实结果中学习,并更新其下一步的想象。这使得它在导航复杂三维空间方面比之前的方法出色得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →