想象一下,你正在教导一位年轻、精力充沛的学徒(即学生),让他学会在繁忙的森林中追踪一只特定的飞鸟。你希望这位学徒动作敏捷、身轻如燕,因为他必须紧随飞鸟奔跑;但他体型太小,无法携带一张详尽沉重的整片森林地图。
通常,当你为了让追踪器在无人机上运行而将其“轻量化”(即变小变快)时,它会丧失清晰辨识的能力。它会被树叶、阴影和其他飞鸟所迷惑,最终丢失目标。本文提出了一种名为EATrack的解决方案,它就像一位引导该学徒的导师。
以下是其工作原理,分解为几个简单概念:
1. 问题:“轻量化”陷阱
想象一台沉重但功能强大的相机(即导师),它能完美看清一切,却因太重而无法安装在小型无人机上。接着,想象一台微小却超快的相机(即学生),它能安装在无人机上,但对细节“视而不见”。
- 问题所在:如果你只是简单地把大相机缩小以使其变小,它就会忘记如何区分飞鸟与背景,开始追踪错误的目标。
- 目标:我们需要让小相机拥有与大相机同等的智能,却无需额外的重量。
2. 解决方案:“双分支”辅导系统
作者设计了一种特殊的训练方法:在“课堂”阶段(训练期间),大相机导师会观察小相机学生的工作;但一旦学生准备好进入现实世界(推理阶段),导师便退场,由学生独立工作。
导师通过两种不同方式帮助学生学习:
- 分支 A:“聚光灯”课程(特征级蒸馏)
想象导师只将聚光灯照在飞鸟身上,并告诉学生:“忽略树木和天空;只关注飞鸟。”
- 工作原理:导师迫使学生的注意力严格集中在目标区域。这帮助学生学会识别飞鸟的真实样貌,忽略令人困惑的背景杂乱。
- 分支 B:"GPS"课程(预测级蒸馏)
想象导师手持一张地图说道:“飞鸟确切就在此处,而不仅仅是‘在附近某处’。”
- 工作原理:导师向学生展示飞鸟的完美位置。学生学会匹配导师对飞鸟位置的置信度,确保其不会偏离航线。
通过同时运用“聚光灯”(它看起来像什么)和"GPS"(它在哪里),学生学会了既目光敏锐又定位精准。
3. 秘密武器:“记忆库”
即使有优秀的导师,飞鸟的外观也可能发生变化(如拍打翅膀、转身或变暗)。
- 技巧:该系统包含一个目标存储库,就像一个小型记忆库。每隔一段时间,追踪器就会拍摄飞鸟的一张新鲜“快照”并保存下来。
- 为何有效:如果飞鸟外观改变,追踪器可以用这张新快照刷新其记忆。这使得追踪即使在飞鸟做出意外动作时也能保持稳定,而不会拖慢无人机的速度。
4. 结果:快速、轻便且智能
该论文在五个不同的无人机追踪挑战中测试了此系统(例如在交通中追踪车辆、在森林中追踪动物,或在城市中追踪物体)。
- 结果:与其他轻量化追踪器相比,EATrack 能够更准确地追踪目标,其性能几乎与那些沉重缓慢的“导师”模型相当。
- 速度:它的运行速度足以在真实无人机上使用(在标准无人机计算机上达到每秒 33.6 帧),意味着它能实时跟上快速移动的物体。
总结
简而言之,EATrack 是一种训练小型快速无人机追踪器的智能方法。作者没有仅仅将追踪器缩小并寄希望于最佳结果,而是利用“导师”给予它两堂具体的课程:聚焦目标和精确定位。他们还为其配备了一个记忆库以应对变化。其结果是一个既轻便到适合无人机搭载,又聪明到绝不会丢失目标的追踪器。
技术摘要:用于高效非对称无人机跟踪的双分支蒸馏 Transformer(EATrack)
1. 问题陈述
无人机(UAV)跟踪面临计算效率与跟踪鲁棒性之间的关键权衡。虽然视觉 Transformer(ViTs)相比卷积神经网络(CNNs)和判别相关滤波器(DCF)提供了更优越的全局建模能力,但其高昂的计算成本使其在资源受限的机载平台上不切实际。
现有的轻量化方法试图通过简化网络架构(例如剪枝层、丢弃令牌或自适应计算)来解决这一问题。然而,本文认为,此类结构简化往往会削弱目标表征的判别能力,导致在涉及快速运动、遮挡和外观变化的复杂场景中性能下降。此外,以往跟踪中的知识蒸馏方法通常在整体层面运行,未能显式利用空间先验或将监督聚焦于目标区域,这可能导致学生模型失去对目标的关注或遭受定位精度下降。
2. 方法论
作者提出了EATrack,这是一个以教师引导的双分支蒸馏策略为核心的高效非对称无人机跟踪框架。其核心理念是在训练期间将全尺寸“教师”ViT 的丰富特征表征和精确定位能力迁移至轻量级“学生”ViT,而在推理过程中不产生额外的计算成本。
2.1. 架构
- 教师模型:一个全尺寸视觉 Transformer(12 层),作为知识的来源。
- 学生模型:一个专为实时推理设计的轻量级非对称 ViT(8 层)。它在第一阶段(Stage 1)独立处理模板帧和搜索帧,并在第二阶段(Stage 2)将它们融合。
- 推理流程:学生模型独立运行。为了处理时间变化,**目标存储(Target Store)**会累积可靠的目标特征。定期从该存储中采样代表性嵌入以更新模板,从而以最小开销实现时间适应。
2.2. 双分支蒸馏策略
训练过程采用两个互补的蒸馏分支来指导学生模型:
空间聚焦的特征级蒸馏:
- 目标:补偿因剪枝而削弱的特征表征。
- 机制:应用源自真实边界框的空间权重掩码到教师和学生特征上。这迫使蒸馏损失(均方误差)集中于目标区域,同时抑制背景噪声。
- 效果:增强了学生模型学习强有力、细粒度目标表征的能力,并提高了对背景杂波的鲁棒性。
预测级蒸馏:
- 目标:提高空间定位精度。
- 机制:掩码 Kullback–Leibler(KL)散度损失在目标区域内专门对齐学生和教师的置信度分布。
- 效果:指导学生复制教师精确的定位行为和边界一致性。
2.3. 训练与损失函数
总训练损失结合了标准跟踪目标与蒸馏项:
L=Lcls+λ1L1+λ2LGIoU+λ3Lfeat+λ4Lpred
其中 Lfeat 和 Lpred 分别是特征级和预测级蒸馏损失。关键在于,教师模型和蒸馏损失在训练后被丢弃;学生模型在推理期间不产生额外计算。
3. 主要贡献
本文概述了三个主要贡献:
- 双分支蒸馏框架:一种新颖的设计,通过空间加权特征监督和掩码预测级对齐,选择性地迁移特定于目标的知识。这通过集中目标区域内的监督,解决了仅全局蒸馏的局限性。
- 细粒度目标感知训练:一种策略,通过聚焦于前景的监督,显式指导模型捕捉外观变化。这增强了模型对细微和动态变化的鲁棒性,同时不增加推理延迟。
- 非对称轻量级框架:非对称骨干网络与时间增强机制(目标存储)的集成,创建了一个平衡跟踪精度和计算效率的框架,使得剪枝后的 Transformer 能够保持具有竞争力的精度。
4. 实验结果
作者在五个无人机基准测试上评估了 EATrack:DTB70、UAVDT、VisDrone2018、UAV123 和 UAV123@10fps。
- 性能:EATrack-DeiT(使用 DeiT-tiny 骨干网络)在所有五个数据集上均取得了最先进(SOTA)的结果,超越了之前的轻量级跟踪器(如 Aba-ViTrack 和 SGLATrack)。例如,在 UAV123 上,其成功率达到68.1%,显著超越了之前的最佳水平。
- 效率:该模型在嵌入式 NVIDIA Jetson TX2 平台上无需加速工具(如 TensorRT)即可运行在33.6 FPS,展示了实时能力。在高端 GPU(A100)上,其达到241.9 FPS。
- 消融研究:
- 蒸馏:在 UAV123 上移除蒸馏导致精度下降 1.4%,成功率下降 1.1%。特征级和预测级分支均被证明是互补的。
- 时间线索:引入时间线索显著提高了动态数据集上的性能(例如,DTB70 上提升 +3.2%,VisDrone 上提升 +5.8%),证实了时间建模在复杂运动场景中的价值。
- 深度分析:该研究确定了层深度与效率之间的最佳平衡,选择了一种在保持轻量级目标的同时最大化性能的配置。
5. 意义与主张
本文声称,EATrack 有效地弥合了无人机跟踪中效率与精度之间的差距。通过利用教师引导的、目标感知的蒸馏策略,该方法使得结构剪枝的 Transformer 能够在不伴随推理开销的情况下,保留大型模型的判别能力和定位能力。
作者强调,他们的方法与现有的基于蒸馏的跟踪器的区别在于:
- 超越全局引导,转向细粒度、目标感知的监督。
- 结合特征级和预测级引导,同时解决表征质量和定位精度问题。
- 通过以超低成本运行的时间适应机制,实现对外观变化的鲁棒性。
结果表明,EATrack 是实时空中应用的一种可行解决方案,这些应用既需要高跟踪精度,又面临严格的计算约束。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。