Towards Sparsely Annotated Open-World Object Detection
本文介绍了稀疏标注开放世界目标检测(SA-OWOD),这是一个应对稀疏监督与未见类别共存情况的新任务,并提出了双视角目标发现(DPOD)框架,以有效解决模糊的监督信号并提升对已知和未知目标的检测能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人识别森林中的动物。在一个完美的教室里,你会给机器人看一张狗、猫和鸟的照片,并精确地圈出它们所在的位置。机器人学得很快,因为一切都被标注好了。但在现实世界中,情况是混乱的。有时,你可能因为赶时间而忘了在照片里圈出某只狗(这被称为稀疏标注,sparse annotation)。其他时候,机器人可能会看到它从未见过的生物,比如鸭嘴兽,而你甚至都不知道该如何称呼它(这就是开放世界问题,open-world problem)。
长期以来,科学家们试图分别解决这两个问题。一组人教机器人去猜测那些缺失的狗在哪里,并假设照片中的一切都是已知的动物。另一组人教机器人去发现新的、未知的生物,但他们假设机器人在处理已知事物时拥有完美的标签。问题在于,现实生活是两者的混合体:你可能有一张照片,既漏掉了一个已知狗的标签,又隐藏了一个神秘的鸭嘴兽。如果机器人没有被教会处理这种混乱,它可能会把漏标的狗误认为是一个新的神秘生物,或者完全忽略掉鸭嘴兽。这篇论文正是针对这个特定的、令人困惑的中间地带展开研究的。
研究人员 HeeJu Han、AJeong Kim 和 Jinsun Park 提出了一个他们称之为稀疏标注开放世界目标检测(SA-OWOD)的新挑战。把它想象成一场侦探游戏,侦探手里拿着一张模糊的照片,其中一些线索丢失了,背景中还有一些无法辨认的奇怪身影。目标是弄清楚哪些模糊的部分实际上是被摄影师漏掉的已知动物,而哪些是真正的、未知的神秘生物。
为了解决这个问题,他们构建了一个名为 DPOD(双视角目标发现)的新系统。想象一下,DPOD 是一个拥有两件特殊工具的侦探。第一件工具是已知目标恢复模块(KTRM)。这个工具充当了一个“二次观察”专家。它会再次扫描照片,寻找那些看起来像机器人已经认识的动物(比如狗)的东西,即使原始照片中没有给它标签。它会说:“嘿,那个形状看起来完全就像我们见过的狗;让我们给它一个标签,这样我们就不会忽略它。”这有助于机器人停止将缺失的狗视为背景噪声。
第二件工具是双重分歧目标生成器(DDTG)。这个工具则更加怀疑。它会从两个略微不同的角度(或“视角”)观察照片,就像我们的双眼观察世界一样。如果机器人对一只狗很有信心,它会在两个角度下对狗的身份达成一致。但如果机器人看到一个奇怪的未知生物,它可能会感到困惑,从一个角度看它会说:“那是鸟吗?还是松鼠?”从另一个角度看又会说:“不,也许是猫?”DDTG 捕捉到了这些产生分歧的时刻。它会说:“如果机器人在这个东西是什么的问题上跟自己争论不休,那它很可能是一个新的、未知的物体!”这有助于机器人发现神秘生物,而不会被缺失的标签所迷惑。
当研究人员测试他们的系统时,他们发现它表现得比以往的方法要好得多,尤其是在标签非常稀疏的情况下。在实验中,他们创造了一个“困难”场景,即从训练图像中删除了大约一半的标签。即使在这种困难条件下,他们的方法也能找到 51.85% 的未知物体(一个指标称为 U-Recall),相比之下,其他顶尖方法在相同条件下很难找到超过 33% 的物体,这是一个显著的飞跃。他们还展示了他们的系统并不会产生混乱;它能像以前一样保持发现已知动物(如狗和猫)的能力,维持了 54.09 的高分。
论文指出,通过将这两个工具结合使用——一个用于恢复缺失的已知项目,另一个用于发现困惑的未知项目——机器人终于可以处理这种标签缺失与新事物同时出现的混乱现实情况。虽然该系统迈出了重要一步,但作者也指出,它仍然依赖于一些固定的规则来决定什么算作“困惑”或“缺失”,这些规则在未来可能需要针对不同类型的物体进行调整。但就目前而言,DPOD 提供了一种极具前景的方式,让机器人能够像人类一样观察世界:带着已知的事实,同时也保持着开放的心态和好奇心。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。