← 最新论文
💻 computer science

YolovN-CBi: A Lightweight and Efficient Architecture for Real-Time Detection of Small UAVs

本文提出了 YolovN-CBi,这是一种通过结合 CBAM 和 BiFPN 模块而增强的轻量级且高效的架构,该架构在结合知识蒸馏后,与基准模型及更新版本的 YOLO 相比,在实时小型无人机检测方面实现了卓越的速度和精度。

原作者: Ami Pandat, Punna Rajasekhar, Gopika Vinod, Rohit Shukla

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ami Pandat, Punna Rajasekhar, Gopika Vinod, Rohit Shukla

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在城市与乡村的上空,一种新型的交通形式正在形成。无人驾驶飞行器,即通常所说的无人机,已成为从捕捉航拍图像到监测农作物及检查基础设施等各种用途的普及工具。它们的通用性和低成本使其在现代生活中变得不可或缺。然而,这种同样的易得性也引入了一个重大的安全挑战。由于无人机体积小、噪音低且具备快速、不可预测的移动能力,它们可以轻易地绕过传统的安保措施。它们可能被用于未经授权的监视,甚至携带危险载荷,从而对敏感区域和公共安全构成威胁。为了应对这一问题,安保团队需要能够瞬间识别这些微小飞行物,即使它们距离很远且在复杂的背景下仅表现为微小的斑点。

多年来,研究人员一直依赖雷达和声音来寻找这些入侵者,但这些方法在繁忙、动态的环境中往往表现不佳。近年来,研究重心转向了计算机视觉,即通过摄像头与人工智能的协作来实现对无人机的实时“观察”与识别。这类工作最常用的工具是一系列被称为 YOLO(意为“You Only Look Once”,即“你只需看一眼”)的 AI 模型家族。这些模型旨在快速扫描图像并寻找目标,非常适合处理实时视频流。然而,一个持久的问题始终存在:虽然这些模型擅长寻找汽车或行人等大型物体,但它们经常会忽略最小的目标。当无人机在数百米外时,在摄像机屏幕上可能仅占据几个像素,而标准的 AI 模型在快速处理其余图像的过程中,往往会忽略这些微小的细节。

来自印度霍米·巴巴国家研究所(Homi Bhabha National Institute)和巴巴原子研究中心(Bhabha Atomic Research Center)的研究小组解决了这一特定的弱点。他们的目标是构建一个既能运行在便携式、电池供电设备上,又足够敏锐以捕捉几乎肉眼难辨的无人机的系统。他们的方法是采用一种经过验证的高效 AI 架构,并对其内部的“眼睛”进行精心修改,使其能够更加关注微小的细节。他们并没有简单地采用最新、最复杂的 AI 模型版本(这些版本通常需要大型计算机才能运行),而是改进了一个较早的轻量化版本。他们添加了两个特定的升级项来帮助系统聚焦。第一个升级项就像一个聚光灯,教会模型忽略无关的背景噪声,并将注意力集中在图像最重要的部分。第二个升级项则改进了模型结合不同距离信息的方式,确保从远处看到的微小物体在图像处理过程中不会丢失。

研究人员将他们命名为 YolovN-CBi 的新设计与广泛的现有模型进行了对比测试。他们在包含 28,000 张图像的海量数据集中对其进行了训练,这些图像涵盖了各种飞行物体在不同光照条件下的情况,包括晴天、多云天空和傍晚光线。为了确保系统真正具备实战能力,他们还创建了一个由固定摄像头拍摄的包含 2,500 张图像的本地测试集,捕捉了约 350 米处飞行的无人机。在这些图像中,无人机极其微小,有时仅表现为 10 到 20 个像素。结果令人瞩目。研究人员发现,他们基于早期 AI 架构修改后的模型,其表现优于目前市面上最新且最先进的版本。虽然较新的模型在识别大型物体方面速度更快,但它们经常无法检测到远处的微小无人机。然而,这种新设计却能以极高的准确度成功识别这些微小目标,证明了经过精心调优的轻量化模型在处理特定任务时,可以比更沉重、更复杂的模型更有效。

为了使这一强大的系统能够应用于安装在安保塔架上或由巡逻人员携带的小型便携式设备,团队又采取了进一步措施。他们使用了名为“知识蒸馏”(knowledge distillation)的技术,这类似于一位名师指导学生。他们利用构建的高精度大型模型,教导一个更小、更快的版本去模仿其决策过程。这一过程使得较小的模型能够在不需要原始模型那样沉重的计算能力的情况下,学习到远处无人机的细微特征。最终的结果是一个轻量化系统,其速度比原始大型模型快了近 83%,同时保持甚至在某些情况下提升了探测微小入侵者的能力。这个经过蒸馏的模型可以在几毫秒内处理视频帧,使其足以进行实时监控。

这项研究还挑战了人工智能领域的一个普遍假设:即最新的工具版本总是最好的。研究人员明确展示了,对于识别微小、遥远无人机这一困难任务,最新的模型并不一定能提供更好的性能。事实上,一些最新的版本在执行这项特定工作时,比其前代版本更慢且准确度更低。通过专注于任务的具体需求——对微小目标的敏感度以及对速度的需求——该团队证明了通过优化,一个稍旧的架构也可以超越尖端的替代方案。他们的工作为安全系统提供了一条清晰的路径,表明通过正确的调整,完全可以构建出一个轻量级、高精度且能在网络边缘运行的检测器,随时准备保护领空安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →