Zero-Harm Feature Calibration and Adaptive Boundary Query for Tiny Object Detection
本文提出了一种用于微小目标检测的联合优化框架,该框架结合了用于防止表示崩溃的零损耗特征校准(ZFC)和用于自适应查询分配的统计边界分配器(SBA),在 AI-TOD-V2 和 VisDrone-DET2019 上实现了最先进的性能,同时显著降低了计算成本。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,机器正在学习像人类一样观察世界,识别照片中的汽车、人物和动物。多年来,执行此任务最成功的工具依赖于一个两步走的过程:首先,它们会扫描图像以寻找潜在物体,然后使用一个单独的手动过滤器来清理结果,去除对同一物品的重复检测。最近,新一代人工智能模型出现了,它们完全跳过了这个手动清理步骤。这些模型将检测视为一个单一的、直接的预测,通过观察一张图像并一次性输出物体列表来完成任务。这种方法已成为许多任务的标准,但在面对极其微小的物体时却表现得非常吃力。在无人机或卫星拍摄的航拍图像中,单个汽车或人可能仅占据屏幕上的几个像素。对于机器而言,这些微弱的信号极其模糊且容易被背景噪声淹没,就像试图在嘈да拥挤的房间里听清一声耳语。
东北大学的研究人员发现,识别这些微小物体的困难不仅仅是一个问题,而是两个紧密相连且相互恶化的难题。第一个问题是,机器的内部“眼睛”往往会削弱它需要看到的信号。标准的注意力机制(旨在帮助模型关注图像的重要部分)会无意中抑制中性或微弱的信号,从而在模型进行分析之前就有效地模糊了这些微小物体。第二个问题是,模型使用固定数量的“搜索查询”(search queries)来寻找物体,而不考虑图像中实际存在的物体数量。如果一张图像中挤满了数千架微型无人机,固定的查询数量就太少,无法找到所有目标;如果图像是空的,模型则会浪费能量去搜索并不存在的东西。研究人员发现,这两个失败案例会相互强化:当图像信号变得模糊时,模型会对存在的物体数量产生误判;而当搜索力度与场景不匹配时,残余的微弱信号就会被忽略。
为了解决这个问题,该团队开发了一个新系统,它同时修复这两个问题,将其视为一个单一的、相互关联的挑战,而非两个独立的漏洞补丁。他们创建了一个特征校准模块,改变了机器处理图像的方式。他们引入了一种新的机制,不再使用那种会切断中性信号的标准过滤器,而是保留这些微弱的中性信号,同时仍然抑制背景噪声。这确保了微小且脆弱的物体轮廓在模型尝试寻找它们之前不会被抹除。同时,他们构建了一个新的分配系统,不再依赖于固定数量的搜索查询。相反,该系统会分析每张特定图像中的物体密度,并平滑地调整其使用的搜索查询数量。如果图像很拥挤,它会自动发送更多的搜索资源;如果图像很稀疏,它则发送较少的资源。这种调整是以一种连续、流体的方式进行的,避免了模型在尝试切换不同预设搜索强度等级时出现的突发跳跃。
研究人员在两个用于航拍目标检测的主要数据集上测试了这种新方法。在 AI-TOD-V2 基准测试中(该数据集包含平均每张图片超过 24 个物体,且存在许多小于 16 像素的实例),他们的系统实现了 32.0% 的平均精度。这代表了相比之前表现最好的模型(得分为 30.2%)有了显著提升。对于最小的物体,这种进步更为明显,新系统比之前的最优模型多发现了近 1.6% 的微小目标。在第二个名为 VisDrone-DET2019 的数据集上(该数据集具有混合的物体尺寸和密度),该系统再次超越了领先模型,达到了 38.2% 的精度。或许最令人惊讶的是,研究人员在实现更高准确度的同时,减少了 49% 的计算功耗。通过在不需要的地方动态减少搜索查询的数量,该系统将计算成本从 1,805.4 亿次浮点运算降低到了 921.0 亿次,而使用的内部参数数量与旧模型完全相同。
这项研究表明,看清“看不见之物”的关键在于理解机器视觉系统中不同部分是如何相互作用的。通过确保图像信号在被计数之前不会被削弱,并允许搜索力度根据场景进行灵活调整,模型可以找回此前丢失的细节。研究人员证实,仅仅修复其中一个问题是不够的:改进图像信号而不调整搜索力度,仍会导致许多物体被漏掉;而调整搜索力度却不修复信号,则会导致过多的误报。只有同时解决信号质量和搜索策略,系统才能发挥其全部潜力。这项工作表明,对于那些物体微小且密集的极具挑战性的检测任务,解决方案不是构建一个更大或更复杂的模型,而是创建一个让视觉过程的不同部分能够相互支持的、更加和谐的系统。其结果是,这台机器能够比以往任何时候都更清晰、更高效地观察拥挤世界中的微小事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。