← 最新论文
💻 computer science

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA 是一种具有空间感知能力的视觉-语言-动作模型,它通过整合深度感知预训练、基于课程的学习微调、思维链推理以及闭环强化学习,增强了在复杂且存在遮挡的城市环境中的无人机目标跟踪能力,从而显著降低了位移误差并提高了成功率,相比于现有的策略表现更优。

原作者: Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名微型、超智能无人机的飞行员,正穿梭在繁忙的城市中。你的任务是跟随一名正在街上行走的人。通常情况下,这很容易:你看到他们,飞向他们,并将他们保持在你的摄像机镜头内。但城市非常复杂。突然间,一栋高楼、一棵茂密的树或是一群人挡住了你的视线。那个人从你的屏幕上消失了。普通的无人机会惊慌失措、做出错误判断,并因为失去了“心理地图”而撞上墙壁。这就是无人机(UAV)追踪的世界——这是一个机器学习如何追逐移动目标的机器人领域。巨大的挑战不仅在于如何看到目标,还在于当你看不到他们时该如何行动。为了解决这个问题,科学家们使用了**视觉-语言-动作(VLA)**模型。把这些模型想象成机器人的大脑,它可以同时“看到”图像、“阅读”像“跟随跑步者”这样的指令,并“执行”通过驱动电机进行移动的动作。

由此诞生了 CosFly-VLA,一种由研究人员设计的、旨在处理这些“盲区”的新型超智能无人机飞行员。CosFly-VLA 不仅仅是盯着屏幕等待目标重新出现,它更像是一个拥有强大想象力的侦探。当目标消失在建筑物后面时,无人机并不会僵住。它利用对城市布局的知识和目标最后已知的速度来推测他们可能在哪里。它会思考:“好吧,他们刚才向右走,而那栋建筑在左边,所以他们肯定会从另一侧出来。”然后,它会飞向一条经过计算的路径去迎接他们。研究人员使用一种特殊的“配方”训练了这架无人机,其中包含了大量长时间“失明”的练习,教会它在眼睛失效时,要信任其空间推理能力而非视觉。他们在名为 CARLA 的高科技视频游戏世界中对其进行了测试,在那里,无人机必须在复杂的城市地图中追逐行人。结果表明,与旧的、更基础的无人机大脑相比,这种新方法在保持目标可见性和避免碰撞方面表现得更好,尤其是在目标被长时间遮挡的情况下。

侦探无人机:CosFly-VLA 如何工作

这篇论文的核心思想是,在城市中追逐移动目标就像玩一场“捉迷藏”游戏,寻找者即使看不见躲藏者也必须保持移动。由 Autel Robotics 和多所大学组成的团队领导的研究人员意识到,大多数现有的无人机系统擅长“观察与跟随”,但在视图被遮挡时的“猜测与恢复”方面表现糟糕。

问题: “盲区”恐慌
想象你在玩一款电子游戏,必须跟随一个角色。突然,一面墙挡住了屏幕。如果你的角色只是停下来或者随机飞行,你就输了。在现实世界中,如果无人机失去了对人的视线,它可能会朝错误的方向飞行、撞到树上,或者干脆放弃。论文指出,传统的无人机训练方式——向它们展示数千张行人行走的图片——并不能教会它们如何处理那些目标“不可见”的时刻。

解决方案:一个具备 3D 思维的大脑
CosFly-VLA 是一个“视觉-语言-动作”模型。让我们用一个简单的类比来拆解它:

  • 视觉(Vision): 它拥有眼睛(摄像头)来观察世界。
  • 语言(Language): 它可以阅读指令,例如“跟随穿红衣服的人”。
  • 动作(Action): 它控制无人机的电机进行上升、下降、向左、向右和转向运动。

但让 CosFly-VLA 特殊的是它的空间感知能力。当目标被遮挡时,无人机不仅仅是在瞎猜;它会构建一个“心理假设”。它会问自己:“那个人最后出现在哪里?建筑在哪里?如果他们继续直走,现在会在哪里?”然后它会飞向那个位置,准备在目标重新出现的一瞬间抓住目标。

训练配方:从学生到大师
研究人员不仅教会了无人机如何飞行,还为它提供了一套非常具体的、分为四步的训练课程,使其成为追踪大师:

  1. “城市地图”训练营(空间定位预训练): 在学习追逐之前,无人机学习了数千张航拍照片和 3D 谜题。它学习了距离、高度以及建筑物如何阻挡视线。这就像在派学生参加寻宝活动之前,先教他们如何看地图。
  2. “由易到难”学校(课程学习): 无人机从目标始终可见的简单路径开始学习。然后,老师们(研究人员)逐渐增加难度,引入了目标在建筑物后长时间消失的情况。这迫使无人机练习其“猜测”技能。
  3. “大声思考”课(思维链): 这是最酷的部分。无人机被教会了在移动之前先“大声思考”。当目标消失时,它会生成一段文本解释,例如:“目标在建筑物后面。他们刚才向右走,所以我应该向右飞并等待。” 这个推理步骤帮助无人机理解它为什么要做出某个动作,而不仅仅是做什么动作。
  4. “实战演习”(强化学习): 最后,无人机在模拟城市(CARLA 游戏引擎)中飞行并通过实践学习。如果它撞车了,它会得到“低分”;如果它在长时间躲藏后成功找到了人,它会得到“高分”。随着时间的推移,它学会了飞得更平稳、更安全。

数据说明
研究人员将他们的新型无人机与旧的标准模型进行了对比测试。他们使用了两种类型的测试:

  • 开环测试(Open-Loop): 无人机观看一段视频片段并预测人的位置,而不实际飞行。
  • 闭环测试(Closed-Loop): 无人机在模拟器中实际飞行,进行实时决策。

结果非常理想。在“开环”测试中,与标准模型相比,CosFly-VLA 在预测目标路径方面的错误更少。具体而言,在熟悉地图上,它将预测目标位置的平均误差降低了约 34%,在陌生地图上降低了 35%。

在真实的“闭环”飞行测试中,成功率的提升更为显著。在熟悉地图上,新型无人机追踪目标的成功率比标准模型提高了 29.8%(从 57% 的成功率跃升至 74%)。在完全陌生的地图上,它也有所提升,尽管幅度较小(2.5%)。最重要的是,新一代无人机撞车的频率更低,并且与目标保持了更安全的距离。

局限性:它仍处于模拟阶段
虽然结果令人兴奋,但论文非常明确地指出了其局限性。所有这些测试都是在计算机模拟(CARLA 游戏)中进行的。这架无人机从未在有真实风力、真实降雨或真实不可预测人群的现实世界中飞行过。研究人员承认,现实世界的物理规律可能比游戏中的更加混乱。他们还指出,无人机是基于一组特定的城市地图和行人行为进行训练的,因此它在面对未曾见过的环境(如茂密的森林或拥挤的室内商场)时可能会遇到困难。

核心总结
CosFly-VLA 表明,对于要在复杂城市中真正发挥作用的无人机来说,它们需要停止仅仅是对所见之物的“反应”,转而开始对所不见之物的“推理”。通过将强大的 3D 空间理解能力与循序渐进的推理过程相结合,这些无人机即使在目标消失时也能保持追踪。这是迈向开发自主无人机的一步,使其不再仅仅是一个跟随圆点的摄像头,而是像一位熟悉社区的资深人类飞行员一样聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →