WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
WorldVLN 引入了首个用于空中视觉语言导航的自回归世界动作模型,该模型通过预测短时程世界状态转换来直接解码可执行的航点动作,并采用一种新颖的两阶段训练框架,结合动作感知的 GRPO 方法,在基准测试中实现了卓越性能,并支持零样本真实世界无人机部署。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一架无人机仅凭语音指令在城市或房屋中飞行。你说:“飞到那栋红色的建筑,然后绕着树转圈”,而无人机必须精确计算出如何控制其电机来实现这一动作。
本文介绍了一种训练无人机掌握这项技能的新方法,称为WorldVLN。其工作原理如下,简单解释:
旧方法:“猜测与验证”
目前大多数无人机飞控(AI 模型)的工作原理,就像一个戴着只展示“当前道路”画面的眼罩的人试图开车。它们观察当前图像和指令,然后猜测下一步动作。
- 问题所在:它们并不真正理解因果关系。它们不知道“如果我现在左转,两秒后就会撞向那堵墙”。它们只是对当下做出反应,这往往在情况变得复杂时导致错误。
新方法:“白日梦无人机”
本文作者认为,要飞得好,无人机必须成为一个白日梦者。在移动之前,它应该想象移动后世界会变成什么样子。
WorldVLN 是一个“世界动作模型”。把它想象成一名飞行员,在做出决定前会闭上眼睛一刹那,预演接下来的几秒飞行,然后决定:“好吧,如果我向前飞,我会看到门;如果我向左飞,我会撞墙。所以,我要向前飞。”
以下是 WorldVLN 执行此过程的逐步流程:
1. “时间旅行”大脑
WorldVLN 不仅仅查看当前的视频流,它还利用一个特殊的大脑(基于视频生成技术)来预测未来。
- 类比:想象你在看电影。普通的 AI 只是观看当前的帧。而 WorldVLN 会暂停电影,并问道:“如果角色从悬崖跳下,接下来的 5 帧会是什么样子?”它会生成一段关于未来场景的短暂、模糊的“梦境”。
2. 将梦境转化为动作
一旦无人机拥有了这个关于未来的“梦境”,它不会只是观看。它会问:“这个梦境是否符合我被要求做的事情?”
- 如果梦境显示它会撞毁,它就知道这个动作是糟糕的。
- 如果梦境显示它安全地接近目标,它就将这个梦境转化为实际的电机指令(航点)。
- 关键区别:它不仅仅是映射“图像 -> 动作”。它映射的是“指令 -> 未来梦境 -> 动作”。
3. “闭环”修正
这是最重要的一部分。在无人机实际执行动作后,它会睁开眼睛,看看真正发生了什么。
- 类比:这就像一名国际象棋棋手。他们计划一步棋,走出这一步,然后立即用新的现实更新他们脑海中的棋盘,再规划下一步。
- WorldVLN 将无人机摄像头拍摄的真实新视角反馈给其“做梦”的大脑。这防止了无人机迷路,或犯下随时间推移而越来越严重的错误。
它们是如何训练它的(训练过程)
研究人员并没有让无人机随机飞行。他们采用了一种两步训练法:
- 第一步:学生(监督学习):他们向无人机展示了成千上万个人类驾驶无人机的例子。无人机学习观察视频和指令,然后“梦”出接下来几秒的飞行,最后模仿人类的动作。这教会了它世界运动的基本原理。
- 第二步:教练(强化学习):在这里,他们引入了一种名为Action-aware GRPO的新方法。
- 类比:想象一位教练,他不仅仅在比赛结束时说“干得好”或“干得糟”。相反,教练会观察玩家做出的每一个动作。如果玩家做出的某个动作最终导致了胜利,教练会给予重奖。如果某个动作最终导致了撞毁,教练会给予惩罚。
- 这教会了无人机提前思考:“如果我现在做一个小转弯,它将在未来帮助我到达目标。”
结果
研究人员在室内和室外无人机基准测试中测试了该方法。
- 得分:WorldVLN 以显著优势击败了所有之前的“猜测与验证”模型(飞行成功率提高了 12% 以上)。
- 现实世界测试:他们将这架仅在计算机模拟中训练过的无人机带到现实世界中飞行,无需任何额外训练。它成功地在室内房间和室外区域遵循了诸如“飞到屋顶”或“绕着椅子转圈”等指令。
总结
WorldVLN 是一个不仅仅对当前所见做出反应的无人机飞控。它会想象接下来会发生什么,检查该未来是否良好,然后采取行动。如果它做错了,它会从真实结果中学习,并更新其下一步的想象。这使得它在导航复杂三维空间方面比之前的方法出色得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。