Hausdorff Distance Matching with Adaptive Query Denoising for Rotated Detection Transformer
本文提出了一种旋转检测 Transformer,通过引入基于豪斯多夫距离的代价以实现更精确的二部图匹配,并采用自适应查询去噪方法以克服静态去噪的局限性,从而在多个基准测试上实现了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人识别一张巨大且杂乱的城市航拍图中的物体。有些物体,比如汽车,很容易找到,因为它们通常是笔直且呈箱形的。然而,其他物体,如港口中的船只或跑道上的飞机,却经常以奇怪的角度倾斜。为了找到这些物体,机器人必须围绕它们绘制一个同样倾斜的边界框。
这项工作介绍了一种新的机器人“大脑”(称为RHINO),它在检测这些倾斜物体方面明显优于早期模型。作者确定了旧机器人难以应对的两个主要原因,并通过两个巧妙的技巧解决了这些问题。
问题:“方形”困惑与“嘈杂”的教师
1. “方形”困惑(Hausdorff 距离校正)
想象一个游戏,你需要将一排红色贴纸(机器人的预测)与蓝色贴纸(实际物体)进行匹配。
- 旧方法: 旧机器人使用一把简单的尺子来测量红色贴纸中心与蓝色贴纸中心之间的距离。由于倾斜物体从某些角度看可能像正方形,这把尺子会陷入困惑。它有时会说:“嘿,这个红色贴纸虽然距离较远,但它的角度与蓝色贴纸相同,所以它是一个匹配!”这导致机器人对同一个物体绘制两个边界框:一个好的和一个置信度较低的坏框。
- 新方法(RHINO): 作者意识到,他们不应只关注中心,而应观察边界框的整体形状。他们使用了一种名为Hausdorff 距离的数学工具。你可以将其想象为测量形状边缘之间的距离,而不仅仅是中心之间的距离。这就像检查红色贴纸的角是否确实与蓝色贴纸的角对齐。这防止了机器人被类方形形状迷惑,并消除了这些重复且无用的边界框。
2. “嘈杂”的教师(自适应查询去噪)
为了更快地教导机器人,旧方法使用了一种名为“查询去噪”的技术。想象一位老师试图通过给学生提供正确答案的模糊、扭曲版本,并要求他们将其修正,来教导学生。
- 问题: 在训练初期,机器人表现很差,因此老师提供的模糊笔记实际上很有帮助。然而,一旦机器人变得更聪明并能做出完美预测,老师仍继续提供相同的模糊、扭曲笔记。机器人会感到困惑:“等等,我知道答案是完美的,但老师却让我修正这个模糊版本。我是该听老师的,还是该相信自己的大脑?”这实际上在训练后期减缓了机器人的学习速度。
- 新方法(RHINO): 作者使老师变得自适应。他们添加了一个“过滤器”,用于检查机器人当前的能力。
- 如果机器人是初学者,过滤器会让模糊笔记通过。
- 如果机器人是专家,且其自身预测已经优于模糊笔记,过滤器会丢弃这些模糊笔记。它会告诉机器人:“你不再需要修正这些垃圾;相信你自己完美的答案吧。”这使训练保持专注和高效。
结果
作者在多个著名的航拍数据集(如 DOTA 和 DIOR-R)上测试了这个新机器人(RHINO)。
- 得分: 与使用相同基础硬件(ResNet-50 骨干网络)的以往最佳模型相比,RHINO 取得了显著更高的分数。在一个数值越高越好的评分标准上,它将准确率提高了约4 到 5 个百分点。
- 对比: 它击败了其他顶级模型,甚至包括那些使用了更强大、更复杂计算机“大脑”(骨干网络)的模型。
简而言之
这项研究指出:“我们构建了一个更好的倾斜物体检测器,通过修复两件事:
- 我们改变了机器人测量距离的方式,使其停止为类方形物体绘制重复的边界框。
- 我们使训练过程更加智能,一旦机器人已经学会了正确答案,它就停止听从‘嘈杂’的示例。”
其结果是一个模型,能够比之前更准确、更少错误地找到倾斜物体(如船只和飞机)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。