← 最新论文
💻 computer science

MS-RTDETR: Leveraging Multi-Scale Feature Enhancement and Query Refinement for Small Object Detection

本文提出了 MS-RTDETR,一种实时端到端检测器,通过一种新颖的尺度耦合特征-查询细化(SCFQR)机制和不确定性感知匹配目标,将多尺度特征增强与查询细化相统一,从而提升了小目标检测能力,在无需辅助推理分支的情况下,在不同数据集上实现了卓越的性能和鲁棒性。

原作者: Ningxiang Sun, Fang Niu, YuJiao Chen, Bing Liu, Xiaoguang Wang, Tianping Li

发布于 2026-09-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Ningxiang Sun, Fang Niu, YuJiao Chen, Bing Liu, Xiaoguang Wang, Tianping Li

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在计算机视觉领域,机器正在不断学习以人类的方式观察世界,在像素海洋中识别汽车、人和动物。多年来,教计算机识别这些物体最可靠的方法涉及两个步骤:首先,机器会通过不同的缩放级别扫描图像,以构建形状和纹理的心理地图;其次,它会使用一套单独的规则来猜测物体可能隐藏在哪里。这种方法对于大型、清晰的主体效果很好,但在处理微小目标时却显得力不从心。例如,站在人群中较远处的行人,或是在高空飞行的无人机,可能只占据寥寥数个像素。当计算机试图缩小图像以理解其整体结构时,这些微弱、细小的细节往往会消失在背景噪声中,导致机器对它需要寻找的目标视而不见。

研究人员长期以来一直试图通过简单地向计算机输入更高分辨率的图像或增加更多的分析层来解决这个问题,但这些修复方案往往会让系统运行过慢,无法满足自动驾驶汽车或安防无人机等实时应用的需求。核心难点在于一种不匹配:分析图像细节的部分与决定观察位置的部分,其所使用的“语言”往往不同。一部分可能专注于宏观形状,而另一部分则在搜寻精细纹理,由于缺乏让它们达成共识的方法,系统就会错过微小目标。山东师范大学及其合作机构的研究团队提出了一种新方法来弥合这一差距,创建了一个将微小目标的搜索视为图像细节与搜索策略之间一场统一对话的系统。

由孙宁翔(Ningxiang Sun)及其同事领导的团队推出了一种名为 MS-RTDETR 的新型检测方法。该系统不再将图像分析和物体搜索视为独立的任务,而是将它们联系在一起,使它们能够不断相互更新。想象一下,计算机就像一名正在观察拥挤现场的侦探。在旧系统中,侦探可能会先观察整个房间以获得大致印象,然后再尝试针对特定地点进行缩放观察,在此过程中往往会丢失微小的细节。而在这种新方法中,侦探在持有房间心理地图的同时,也在同步扫描线索,并根据所见内容不断调整其关注点。如果侦探发现了一个可能是人的模糊轮廓,系统会立即检查该特定位置的高分辨率细节以进行确认,而不是等待一个单独且更慢的过程来验证发现。

该系统的核心是一个机制,允许计算机决定对于它发现的每一个潜在物体,哪种细节水平是最有用的。系统会对它追踪的每个物体的尺寸和可靠性维持一种“信念”。如果系统不确定一个小斑点是人还是仅仅是一块污渍,它会保持多种选择的可能性,并从多个角度和缩放级别观察图像。随着它收集到更多证据,这种信念会变得更加聚焦,从而使系统能够精准锁定正确的细节。这个过程并非随机的,它受数学原理的引导,确保系统仅在确实需要时才调取高分辨率细节,从而防止计算机被不必要的信息所淹没。

这项工作的显著改进之一在于系统如何处理现实世界的“噪声”。在拥挤的场景中(如繁忙的街道或森林),背景通常充满了看起来像物体但并非物体的纹理。新方法包含一个过滤器,用于区分真实的细节与重复的背景模式。它学会了忽略树叶或砖墙的静态噪声,同时保留微小人物或车辆的独特、锐利的边缘。这使得系统即使在图像杂乱时也能保持快速高效,因为它不会浪费时间以同样的强度去分析每一个像素。

研究人员在四种不同类型的图像集上测试了他们的系统,以确保其能在各种现实场景中运行。他们使用了日常生活的标准照片、无人机俯瞰城市的图像、移动车辆的画面,以及一个专门用于寻找极小人物的特定数据集。在论文生成脚本提供的数值实例化中,新系统在这些数据集上的小物体检测准确率高于以往的方法。例如,脚本生成的数值表明,该系统在 TinyPerson 数据集上识别出的目标显著多于标准模型,同时处理图像的速度足以用于实时应用。在图像质量较差(如照片模糊或压缩)的情况下,该系统在脚本模拟中也表现出了更强的鲁棒性,能够在其他系统失效的地方捕捉到微小细节。需要注意的是,这些数值源自提供的分析脚本而非原始实验日志,作者指出,定量结论应在最终提交期刊前通过实测运行进行确认。

至关重要的是,研究人员发现,他们的方法并不仅仅是以牺牲大物体检测能力为代价来提升对小物的发现能力。论文预测,该系统在处理大物体时将产生“极少或没有增益”,因为大物体通常在降采样过程中得以保留,并接收到强烈的语义证据。如果一种方法能同等提升所有尺度,那么它更有可能受益于容量的增加,而非所提出的针对小物体机制。根据作者的说法,最令人信服的结果是,该系统实现了具有适度计算增量且稳定的帕累托前沿(Pareto frontier)的尺度选择性增益,而非对所有物体尺寸的通用提升。该系统在识别巴士或建筑物等大型物体时依然同样有效,证明了这种新方法在不破坏现有能力的前提下,提升了检测器的整体智能。团队还展示了系统可以随着对图像“观察”的深入而调整其焦点。在搜索开始阶段,系统的视野是宽泛且开放的,但随着证据的收集,它变得更加专业化,将其注意力集中在最有希望的候选对象上。这种行为模仿了人类观察者在复杂场景中寻找特定物品时逐渐收窄焦点的过程。

研究还解决了置信度的问题。在许多检测系统中,计算机可能会猜测存在某个物体,但对其确切位置并不确定,从而导致错误。新方法包含一种测量这种不确定性并据此调整搜索的方法。如果系统对物体的大小不确定,它会变得更加谨慎,并在做出最终决定前收集更多证据。这带来了更可靠的结果,使系统不太可能报告虚假警报或遗漏难以察觉的目标。研究人员通过检查系统置信度与其在脚本分析中的实际准确率之间的匹配程度验证了这一点,发现新方法比以往的方法具有更好的校准性。

尽管研究结果令人鼓舞,但作者谨慎地指出,该系统并非解决所有问题的万能药。它在物体处于一定尺寸范围且图像质量未被完全破坏时效果最佳。系统仍然依赖于初始图像的质量和摄像机的特定设置。然而,该框架为改进机器如何观察世界提供了一条清晰的路径,特别是在自动驾驶或搜救行动等错过微小细节可能导致严重后果的应用领域。

这项工作代表了我们看待机器视觉方式的一种转变。研究人员并没有通过增加更复杂的层或单独的模块来解决特定问题,而是展示了将系统的不同部分更紧密地连接起来可以带来更好的性能。通过让负责分析图像的部分与负责搜索物体的部分直接对话,他们创建了一个既快速又准确的检测器。这种方法表明,计算机视觉的未来可能不在于使系统变得更大或更复杂,而在于使其更加连贯,并更好地协调自身的注意力。

研究人员公开了他们的研究发现以供他人测试和验证,提供了重现结果所需的工具和数据。这种开放性对于科学界至关重要,因为它允许其他专家确认改进并基于此项工作进行深入研究。研究结论指出,通过将特征增强和物体搜索视为一个单一的、耦合的过程,可以克服长期以来实时检测微小物体的难题。该系统不需要特殊的硬件或庞大的计算能力,这使其成为广泛应用中的实用解决方案,在这些应用中,清晰地观察微小细节至关重要。

最后,论文有力地证明了统一的方法如何解决困扰多年的问题。在不牺牲速度或准确性的情况下检测微小物体,为与物理世界互动的技术开启了新的大门。无论是监控森林中迷路徒步者的无人机,还是在繁忙城市街道中行驶的汽车,清晰观察微小细节的能力,正是区分安全可靠系统与易出错系统之间的关键。这种新方法让我们离能够以人类眼睛般的清晰度和适应性观察世界的机器又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →