← 最新论文
💻 computer science

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

本文介绍了 **DroneEyes**——首个针对微小空中目标的像素级开放词汇数据集,以及 **SkyAnchor**——一种具有语义感知标记路由和分层记忆库的记忆增强多模态大语言模型,旨在实现对流式航拍视频中微小目标的实时、高效资源利用型理解。

原作者: Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名驾驶着小型高科技无人机的飞行员,正飞越一座繁忙的城市。你的任务不仅仅是拍摄漂亮的画面;你还必须实时回答人类操作员提出的问题,比如“找到那辆红色的车”或“向我展示那辆白色卡车”。这就是空中视觉(aerial vision)的世界——在这里,计算机试图理解它们从空中所看到的内容。但难点在于,无人机看到的物体往往极其微小——就像巨大野餐布上的一只蚂蚁。更难的是,由于无人机正在飞行,它不能等待整部电影播放完毕后再作答;它必须在视频流逐帧传输时立即做出反应。这被称为流式视频理解(streaming video understanding)

现在,想象一下你要在跑马拉松的同时,向朋友描述那只微小的蚂蚁。你不能在每一步都背着一本记录了所有步骤的巨型相册(那太重了),但如果你忘记了一秒钟前你在哪里,你可能会在人群中丢失那只蚂蚁。这正是研究人员在使用**多模态大语言模型(MLLMs)**时面临的问题。这些模型拥有超级聪明的AI大脑,既能看也能读,但它们通常会被微小的细节搞得应接不暇,或者在视频持续滚动时忘记过去。这篇论文解决了如何教导这些AI大脑在实时的无人机航拍画面中识别微小移动物体,且不会感到困惑或耗尽电池电量的问题。


微小目标问题

研究人员首先意识到,现有的AI工具在处理这项特定工作时表现得很糟糕。大多数AI模型是在公园里拍摄的人和狗的视频上进行训练的,其中的主体又大又容易观察。当你把无人机视频对准AI时,它会为了节省空间而将整个图像压缩,把一辆微小的汽车处理得和一栋巨大的建筑一样大。结果呢?那辆微小的汽车就在模糊中丢失了。

为了解决这个问题,团队首先建立了一个新的训练场,名为 DroneEyes。你可以把它想象成一个拥有2,140段高清无人机视频的海量图书馆,但有一个特别之处:每一帧中的每一个微小物体都经过了像素级的精确勾勒。他们不仅仅是在物体周围画框,而是描绘出了一个遥远的行人或一辆银色小车的精确形状。这个数据集包含了超过17.6万对问答,教会了AI不仅要找到这些微小的物体,还要对其进行详细描述,例如:“那是圆形庭院里的一座红色雕塑。”

认识 SkyAnchor:无人机的新大脑

有了这些新数据,团队构建了一个名为 SkyAnchor 的新AI模型。如果说旧模型像是试图一边杂耍一边读书的学生,那么 SkyAnchor 就像是一个带着组织有序的笔记本和一支神奇荧光笔的学生。它通过两个巧妙的技巧解决了无人机视觉中的两大难题:

  1. 神奇荧光笔(语义感知标记路由 - Semantics-Aware Token Router):
    通常,当AI观察视频时,它会将图像分解成数千个微小的拼图碎片(称为“标记/tokens”)。它平等地对待每一个碎片,即使是无聊的背景天空也是如此。SkyAnchor 使用一个“路由”,其作用就像一支智能荧光笔。它扫描图像并说:“嘿,那片天空很无聊,我们忽略它吧,”但同时又说:“那辆微小的汽车很重要,我们要保留它的所有细节!”这使得AI能够将脑力集中在微小目标上,而无需处理整个庞大的图像,从而节省了能量并保持了细节的清晰。

  2. 双笔记本系统(分层记忆库 - Hierarchical Memory Bank):
    由于无人机正在飞行,AI需要记住几秒钟前看到了什么,才能知道物体现在的方位。但它不能永远记住所有事情,否则它的记忆会瞬间填满。SkyAnchor 使用了一个两层记忆系统:

    • “它是谁”笔记本(语义记忆 - Semantic Memory): 它存储物体的身份。它会记住:“那是一辆银色轿车。”这部分会在记忆中保留很长时间,这样AI就不会忘记正在追踪的目标。
    • “它在哪”笔记本(追踪记忆 - Tracking Memory): 这是一个短期的、滑动窗口式的记忆,仅保存最后几秒的移动轨迹。它会记住:“汽车刚刚向左移动了。”
      通过将“身份”与“位置”分离,即使在无人机放大或缩小视野时,Sky-Anchor 也能平滑地追踪目标,而不会产生混乱或丢失目标。

他们的发现

团队在全新的 DroneEyes 数据集上测试了 SkyAnchor,并将其与目前最先进的AI模型进行了对比。结果令人印象深刻。在描述物体的任务中,SkyAnchor 的得分比最好的通用模型高出两倍。在寻找并勾勒微小物体(指代分割)方面,尽管 SkyAnchor 更小、更轻量,但它仍比次优模型高出了 15.3%

但真正的考验在于,这个AI是否能处理一个它从未见过的全新环境。研究人员将它投入到了一个名为 SkyFind 的不同数据集——该数据集以海洋场景为特色。在没有任何额外训练的情况下,SkyAnchor 在准确寻找物体方面的表现比之前的最佳结果提高了 25.9%。这表明该模型学习到的是一种识别微小事物的通用技能,而不仅仅是死记硬背训练视频。

现实世界飞行

最后,团队并没有让 SkyAnchor 仅仅停留在计算机实验室里。他们将其部署在了一架飞越大学校园的真实无人机上。他们优化了软件,使其可以在小型便携式计算机(NVIDIA Jetson AGX Orin)上运行,而无需将数据发送到云端。结果是,该系统的运行速度比标准设置快了 3.05 倍,使无人机能够在飞行时实时回答问题并绘制轮廓。

在现实世界的视频中,SkyAnchor 成功追踪了一辆红色SUV、一辆隐藏在碎石路上的银色汽车,甚至还追踪了一条池塘里的锦鲤,尽管当时无人机正在移动且视角不断变化。它没有在阴影中迷失,也没有被看起来相似的物体所迷惑。

核心结论

这篇论文表明,通过结合高质量的新数据集、智能记忆系统和聚焦型路由,我们可以让AI在实时的无人机视频中更好地发现微小物体。它证明了你不需要一台庞大、沉重的计算机来完成这项工作;一个精简的、具备记忆感知能力的模型就可以在无人机上运行,并帮助操作员实时找到他们正在寻找的目标。虽然论文展示了在特定数据集和现实测试中的强劲表现,但也暗示了未来的工作重点将是如何让系统更快,以及如何教导它自动控制无人机的飞行路径,以始终将目标保持在视野中心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →