来自北航大学的研究人员陈科宇、徐子辉和李国提出了一种巧妙的四步“侦探”框架,将原始视频转化为一个清晰、可审计的故事。把它想象成一个协同工作解决谜题的专家团队。首先,一个眼神犀利的“观察员”(YOLOv8 检测器)在视频的每一帧中找到无人机。接着,一个“追踪器”(ByteTrack)跟随无人机的路径,即使无人机被云层或建筑物短暂遮挡,也能将其运动轨迹缝合在一起。但真正的魔力发生在这里:研究团队并没有直接将视频交给一个超级智能的 AI 并寄希望于它能猜出行为,而是构建了一个“结构化证据”层。这一层就像一名法务会计,将无人机的路径转化为硬性的数字:它的速度有多快?它是直线运动还是圆周运动?它是变大了(接近)还是变小了(远离)?它是在像蜂鸟一样盘旋吗?
一旦计算出这些数字,它们就会与无人机的几张关键快照结合在一起,并输入到一个“视觉语言模型”(一种既能看图又能读文字的 AI 类型)中。论文发现,这种组合正是其成功的秘诀。当 AI 仅被给予视频帧(就像一本模糊的照片集)时,它表现得很吃力,识别主要行为的准确率仅为 22% 左右。这就像是让一个人通过六张随机的静态照片来猜测一部电影的剧情。然而,当 AI 同时获得“结构化证据”(关于速度和方向的硬性数字)以及图像时,其准确率显著提升。使用这种结合了数字和图像的最佳方案,在识别主要行为方面的准确率达到了 70%。
这项研究明确排除了“强大的 AI 仅凭观察几帧画面就能神奇地理解复杂运动”的可能性。作者表明,如果没有明确的数值证据,AI 本质上是在黑暗中盲目猜测。他们还发现,虽然数字承担了主要的工作量,但图像仍然能提供微小但有益的提升,尤其是在路径看起来相似但背景语境不同的混乱情况下。其结果是一个不仅能说“检测到无人机”,还能说出“该无人机正以高曲率和低速度进行环绕,暗示存在监视模式”,并能用实际数学逻辑支撑这一结论的系统。这使得系统具有“可解释性”,意味着人类操作员可以查看证据并验证 AI 的推理过程,将一个“黑箱式”的猜测转变为一份可靠、可审计的报告。