← 最新论文
💻 computer science

Moving Like a Human: Ego-Motion-Normalized Temporal Signatures for Real-Time Aerial Person Tracking on Milliwatt-Class Hardware

本文介绍了 EMTS-Det,一种超轻量级、实时的空中人员追踪系统,它通过利用解析计算的、经过自我运动归一化的运动特征来取代学习型时序处理,从而在毫瓦级硬件上实现了高精度,使得在树莓派 Zero 2W 等传统模型无法运行的设备上实现鲁棒的检测与追踪成为可能。

原作者: Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

无形的追踪者:无人机如何学会跟随而不晕头转向

想象一下,你正试图在一个人声鼎沸、混乱不堪的舞池中,站在一个摇晃旋转的平台上跟随一位朋友。如果你只看一眼房间的静态快照,你的朋友可能看起来就像一个微小且模糊的污点,与一堆外套或一个影子无法区分。这就是无人机在尝试“跟随”人类时面临的日常挣脱。它们运行在极其微小的、由电池供电的计算机上,与我们手机里的超级计算机相比,这些计算能力非常弱,而且风会让无人机剧烈抖动。更糟糕的是,他们追逐的人往往离得非常远,在摄像屏幕上只占据几个像素——对于标准软件来说,由于太小,仅凭衣服或脸部特征是无法识别出来的。

解决方案并不是要构建一个更聪明的“大脑”,而是要改变无人机观察世界的方式。与其试图记住一个人“看起来”像什么,这篇论文建议教导无人机去注意到一个人是如何“移动”的。这就像是试图通过衬衫颜色来识别一名跑步者(颜色会随风力和光照而变化),不如注意到他们的腿部正以一种有节奏的步行模式在移动,而背景场景则在飞速掠过。通过先在数学上抵消无人机自身的抖动和旋转,该系统将一段混乱、模糊的视频转化为了一个清晰的信号,它在说:“嘿,那个东西是在自主移动的。”这使得即使是最微小、最廉价的计算机芯片也能实时追踪人类,这在以前被认为是受限于如此有限的硬件而无法实现的。


论文:《像人类一样移动》

这项研究背后的研究人员使用的是计算能力非常有限的无人机(具体为像 Raspberry Pi Zero 2W 这样的“毫瓦级”硬件),旨在解决一个棘手的问题:如何让无人机在不依赖超级计算机的情况下跟随一个人而不迷失方向。他们发现,在这些微型无人机上使用标准的、沉重的 AI 检测器(如著名的 YOLOv8n)是注定失败的。这些标准检测器运行速度太慢,每秒仅能处理 1.95 帧,并且在目标人物很小且相机抖动时表现极差。

相反,他们构建了一个名为 EMTS-Det 的新系统。可以将这个系统想象成一个五步协作的侦探团队,共同锁定人类:

  1. 稳定器(阶段 A): 首先,系统确定无人机是如何移动和旋转的。这就像一名舞者清楚地知道自己旋转了多少,以便忽略这种动作。
  2. 运动滤波器(阶段 B): 接着,它对视频进行数学上的“减法”,减去无人机的运动。如果无人机向左转,图像就向右转以抵消这种运动。剩下的部分是什么?只有那些在自主移动的事物。在经过过滤后的视图中,一个行走的人会呈现为一个明亮的、发光的色块,而静止的岩石或摇摆的树木则消失了。
  3. 微型侦探(阶段 C): 这是主要的 AI 大脑,但它极其微小——只有 22,000 个参数(相比之下,标准检测器拥有数百万个参数)。因为“运动色块”已经非常清晰,这个微型大脑不需要费力去猜测物体是什么,它只需捕捉到移动色块的中心即可。
  4. 追踪器(阶段 D): 一旦找到人,它就会使用一种称为卡尔曼滤波(Kalman filter)的数学工具进行锁定。这就像是一种心理预测,即使风吹动了无人机或人暂时消失在灌木丛后,它也能预测人的下一个位置。
  5. 步态检查员(阶段 E): 最后,为了确保它没有误锁上一根摇摆的树枝或一片云影,一个微小的“验证器”会检查运动模式。它会询问:“这个物体的运动模式像人在走路吗?”如果答案是否定的,它就会拒绝该目标。

他们的发现(以及他们拒绝了什么)

结果令人印象深刻。在 Raspberry Pi Zero 2W 上,他们的系统运行速度达到了 31.85 帧/秒,且具有高准确度,而标准的 YOLOv8n 检测器则缓慢爬行在 1.95 帧/秒。在包含 1,000 段无人机视频的现实测试中,他们的系统成功追踪人类的准确度得分(AP25)为 0.462,而标准检测器仅能达到 0.172

至关重要的是,论文明确排除了几种许多人可能认为会有帮助的想法:

  • 他们拒绝了“学习”运动: 团队测试了添加复杂的“时间偏移”(temporal shift)模块(即通过观察过去和未来的帧来理解运动的 AI)。他们发现,这些模块实际上让系统变得更糟。因为运动已经在阶段 B 中通过数学方式清理干净了,AI 不需要去“学习”它;尝试去学习只会浪费能量并让系统产生困惑。
  • 他们拒绝了将“外观”作为主要线索: 当他们尝试仅使用视觉外观(忽略运动数据)来训练系统时,系统崩溃了。在现实世界的画面中,“仅靠外观”的版本完全失效,这证明了对于微小、遥远的目标,仅仅知道一个人“看起来”如何是不够的;你需要知道他们是如何“移动”的。
  • 他们拒绝了标准校准: 他们发现,使用通常用于设置这些微型 AI 芯片的方法(使用“移动平均值”来估算数值范围)会导致系统发生无声的失败。通过切换到“最大-最小”(min-max)方法,他们修复了准确度问题,此前该准确度已被标准方法削减了一半。

核心结论

这篇论文证明了,你不需要一台庞大、昂贵的计算机来从空中追踪一个人。通过利用简单的几何学首先消除无人机自身的抖动,然后让一个微小的、专门化的 AI 去寻找人类步行的特定“特征”,你可以在成本极低的硬件上实现实时追踪。在实地测试中,该系统仅用 1.3 秒 就成功锁定了目标,并在目标躲在障碍物后时,仍保持了 97.9% 的锁定成功率。

作者谨慎地指出,虽然他们的系统是一个重大进步,但它仍然存在局限性。例如,如果一个人长时间保持静止不动,系统可能会丢失目标,因为它依赖于运动。然而,对于“跟随我”类无人机这一特定任务——即目标通常处于移动状态——这种“几何优先,学习在后”的方法证明是一种强大且高效的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →