← 最新论文
🤖 AI

Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

Fly0 是一个通过利用多模态大语言模型进行 2D 指令接地与基于深度的 3D 定位,从而将语义推理与几何规划解耦的新型框架,由此实现了在成功率和导航误差方面均显著超越最先进基准模型的、鲁棒且低延迟的零样本空中导航。

原作者: Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的无人机不再仅仅是一个遥控玩具,而是一个能够理解你语音指令的智能探险家,比如:“飞向大橡树后面那座红色的谷仓。”这就是**视觉-语言导航(Vision-Language Navigation)**的梦想。长期以来,科学家们一直试图教会机器人通过听取词汇和观察图像来确定行进方向。但问题在于:思考与移动发生的频率完全不同。一个聪明的计算机大脑(例如大型语言模型)可能需要一秒钟来理解“红色谷仓”是什么意思,但正在空中飞行的无人机每秒钟需要做出数百次安全决策,以避免撞到树枝。如果无人机每次都要等待大脑思考,它就会坠毁。研究人员提出的核心问题是:我们如何让一个缓慢、聪明的脑子在给出指令的同时,不让快速飞行的躯体感到恐慌或发生碰撞?

这篇论文介绍了一个巧妙的解决方案,名为 Fly0,它充当了缓慢、深思熟虑的大脑与快速、反应敏捷的飞行员之间的翻译官。Fly0 并不是要求聪明的脑子每秒钟都来操控无人机的转向,而是让大脑只在必要时(大约每两秒一次)做一下“家庭作业”——在现实世界中设定一个稳定的、隐形的“目标锚点(target anchor)”。这就像是在玩“捉迷藏”游戏:聪明的脑子(呼唤者)喊出一个位置,“你在大树附近!”然后无人机(游泳者)就开始朝着那个点游去。即使大树被灌木丛遮挡,或者摄像头暂时失去了对它的视野,无人机也不会惊慌。它会朝着大脑之前设定的那个隐形锚点继续游动,同时利用自身的快速传感器来躲避树枝和岩石。只有当无人机偏离航线太远,或者目标发生变化时,大脑才需要再次开口说话。

研究人员在高度先进的计算机模拟和真实世界的无人机飞行测试中都验证了这个想法。他们发现,这种“设定后即忘掉(set it and forget it)”的方法比让聪明的脑子直接尝试操控无人机要有效得多。在测试中,与其他的智能方法相比,Fly0 帮助无人机成功到达目标的频率在模拟中提高了约 23.7%,在现实生活中提高了 21.4%。它也更少发生碰撞,并且在目标被遮挡或周围有干扰物体时犯错更少。论文指出,秘诀不仅在于拥有更聪明的脑子,而在于建立一个更好的桥梁,连接那个大脑缓慢的思考与无人机快速的动作。通过将“思考”与“飞行”分离但保持连接,无人机终于可以在理解复杂指令的同时,既不会失去理智,也不会折断翅膀。

问题所在:大脑太慢,跟不上身体的速度

要理解为什么 Fly0 特别,你必须想象无人机的两项主要工作:思考飞行

“思考”部分由一个庞大的 AI 模型(称为 MLLM)完成。这个模型就像一位天才图书管理员,能够阅读地图,理解像“飞向树木前方”这样的句子,并在图片上指明正确的位置。但这位图书管理员很慢。他需要时间阅读、思考并写下答案。

“飞行”部分则由无人机的飞行控制器完成。这就像是一位本能反应极强的运动员,需要每秒调整 50 到 100 次 翅膀和电机,以保持飞行并避免撞击物体。

在旧的方法中,科学家试图让图书管理员来操控运动员。他们要求缓慢的大脑在无人机每次移动时都给出一个新的转向指令。这导致了三个大问题:

  1. 速度不匹配: 无人机会等待大脑思考,而当答案传回时,无人机已经偏移或者即将撞上墙壁了。
    可是,由于大脑的反应速度远低于物理运动的速度,这种延迟会导致严重的后果。
  2. 记忆缺失: 如果无人机转头,导致目标(如一棵树)从摄像头视野中消失,缓慢的大脑就会忘记它的位置。无人机会陷入困惑,停止移动或原地打转。
  3. 精度问题: 大脑可能会说“飞向那棵树”,但无人机需要知道在 3D 空间中的确切位置才能停下来,以免撞到树干。简单的文本回答对于高速飞行来说不够精确。

解决方案:持久性锚点

Fly0 通过改变游戏规则解决了这个问题。它不是要求大脑进行转向控制,而是要求大脑设定一个目的地,然后退居幕后。

以下是 Fly0 的工作步骤:

  1. “契约”(结构化输出): 当无人机向大脑发送一张图片和一个指令(例如“飞向右侧电线杆的前方”)时,大脑并不仅仅是进行猜测。它遵循一套严格的规则手册。它必须返回一个特定的信息包:图像上的一个点、一个围绕物体的框、一个关系词(如“前方”或“上方”)以及一个置信度分数(它有多确定)。这防止了大脑给出模糊或混乱的答案。

  2. “3D 提升”(不确定性检查): 大脑给出的答案只是图片上的一个 2D 点。Fly0 将这个点提取出来,并利用深度传感器(如 3D 摄像头)将其“提升”到现实世界中。但聪明之处在于:它会检查错误。如果深度数据不稳定或物体被遮挡,Fly0 会说:“我不信任这个数据”,并忽略掉这些糟糕的数据。只有当目标足够稳固时,它才会接受该目标。

  3. “自由空间”调整: 如果指令是“飞向树木的前方”,大脑可能会指向树干。但无人机不能飞进树里。Fly0 有一条规则:“好吧,树在这里,但‘前方’实际上是在它前面 2 米处的空旷区域。” 它会将目标移动到一个安全的、开阔的位置,让无人机可以实际悬停在那里。

  4. “持久性锚点”(神奇的技巧): 一旦目标设定好,Fly0 就会将其保存为一个持久的 3D 锚点。这就像是一个留在无人机记忆中的 GPS 坐标,即使摄像头看不见那棵树了,坐标依然存在。此时,无人机快速的飞行控制器接管工作。它不再理会缓慢的大脑,而是直接飞向那个保存下来的锚点,并利用自身的快速传感器来躲避障碍物。只有当无人机接近目标或目标发生变化时,大脑才需要再次醒来。

研究结果表明了什么

研究人员通过两种方式测试了这个系统:一种是在超真实的计算机模拟中,另一种是在真实的公园和校园中使用实际无人机进行飞行测试。

  • 成功率: 在计算机测试中,Fly0 的成功率比次优方法高出 23.7%。在现实生活中,它的成功率高出 21.4%。这是一个巨大的飞跃。
  • 安全性: 无人机的碰撞率显著下降,这表明“锚点”方法比让缓慢的大脑直接尝试转向更加安全。
  • 处理混乱的能力: 当出现多个相似的树木(“重复物体”问题)或目标被叶子遮挡时,Fly0 的表现要好得多。因为它在记忆中保留了锚点,所以即使视野被遮挡,它也不会感到困惑。
  • 速度: 即使与“大脑”(运行在强大的服务器上)的连接很慢或存在延迟,该系统依然有效。无人机能够保持平稳飞行,因为它不需要每秒钟都请求新指令。

Fly0 不是什么

必须明确指出 Fly0 不是什么。

  • 不是一个新的飞行控制器。无人机仍然使用标准的、经过验证的飞行软件(Ego-Planner)来进行实际移动。
  • 不是一个新的 AI 大脑。他们使用的是现有的强大语言模型(如 Qwen2.5VL),并没有发明新的模型。
  • 不是解决所有问题的万能药。如果无人机处于极其茂密的森林中且没有开阔空间,或者指令极其复杂且具有嵌套关系(例如“那棵位于指示牌后方、且位于路灯左侧的树”),系统仍然可能会产生困惑。论文承认,理解复杂的空间关系仍然是一个难题。

总结

Fly0 的主要启示是:要让无人机变得聪明,我们不仅需要更聪明的脑子,还需要更好的接口——即更好的方式,将系统的缓慢思考部分与快速反应部分连接起来。通过将 AI 定位为“目标设定者”而非“操纵者”,并通过给无人机一个稳定的记忆锚点来维持航向,我们可以让自主飞行变得更安全、更可靠,并能够应对复杂的现实世界。论文表明,这种职责分离是解锁下一代飞行机器人的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →