← 最新论文
💻 computer science

Open-World Semantic Segmentation with Sensitivity Modeling

本文提出了一种新颖的开放世界语义分割框架,通过集成第三个“敏感性解码器”来捕捉细粒度的纹理异常和激活不稳定性,从而增强对未见或异常内容的检测,以此补充现有的基于原型和对比学习的方法,在保持闭集准确性的同时,实现卓越的异常分割和新类发现。

原作者: Anastasios Romanos Varvarigos, Nikos Giakoumoglou, Tania Stathaki

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Anastasios Romanos Varvarigos, Nikos Giakoumoglou, Tania Stathaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人开车。你给它看了上百万张道路、汽车和行人的照片,它学会了完美地标注每一个像素。但随后,你把机器人带到了现实世界。突然间,它看到了一只戴着帽子的巨大霓虹粉色长颈鹿,或者高速公路上的一堆神秘且发光的碎片。在教室里的“封闭世界”中,机器人对这些东西没有标签。它并没有说:“我不知道那是什么!”,而是自信地猜测:“那是一辆车!”或者“那是一棵树!”这种过度自信是危险的。如果机器人认为一堆垃圾是马路,它可能会直接撞上去。

这就是“开放世界”视觉的问题。科学家们正试图构建一种不仅能识别已知事物,还能发现自己“不知道”的事物的AI。他们希望AI能既能说出“那是一辆车”,也能同样确定地指出“那是一个奇怪的未知物体”。挑战在于,大多数AI模型就像过度热心的学生,即使在毫无头绪时也会强行给出答案。它们需要一种方法,让自己在看到奇怪事物时能感受到“不确定性”,而无需先看过成百万上千万个各种各样奇怪事物的例子。

于是,来自伦敦帝国理工学院的研究人员开发出了一种新型AI大脑来解决这个问题。他们称之为“开放世界语义分割”,但你可以把它理解为在教机器人成为一名更好的侦探。

旧侦探的问题

以往解决此问题的方法使用的是“双解码器”系统。想象一个有两个助手的侦探:

  1. 语义助手(The Semantic Assistant): 这个人非常擅长识别已知的嫌疑人。他观察一个像素并说:“那是路!”或“那是车!”,这是基于一份已知的类别清单。
  2. 对比助手(The Contrastive Assistant): 这个人观察图像的“氛围”。他检查像素的特征是否符合已知事物的总体模式,或者是否漂浮在远离已知领域的“未知领域”。

问题在于,这两个助手都关注宏观图景。他们就像站在山上观察森林的人;他们能看到树木的大致轮廓,但可能会错过生长在树根处的一朵微小的、奇特的蘑菇。如果一个奇怪的物体被部分遮挡或具有奇怪的纹理,这两个助手可能仍会认为:“嗯,这看起来挺像一辆车的”,从而忽略了异常情况。他们太粗略、视角太宏观,以至于无法捕捉到细微的局部异常。

新的第三位侦探:敏感度解码器

论文作者意识到他们需要第三个助手,这个助手不在乎物体“是什么”,而是在乎AI对它的“感觉如何”。他们称之为敏感度解码器(Sensitivity Decoder)

把敏感度解码器想象成一个拿着放大镜且嗅觉极其灵敏的侦探。当其他两个助手在观察大形状和距离时,这个新助手正在放大观察微小的细节。它寻找的是“激活异常”(activation irregularities)。

这里有一个神奇的比喻:想象AI的大脑是一个巨大的管弦乐团。当它看到一辆正常的汽车时,乐手们(神经元)演奏着平滑、稳定的旋律。但当它看到一些奇怪的东西——比如一个部分隐藏的、奇怪的物体时——乐手们开始结巴、节奏失调,或者奏出不属于这里的尖锐音符。敏感度解码器就是那位专门倾听这些结巴和走调音符的指挥。它不需要知道那个奇怪物体到底是什么;它只需要知道音乐听起来很“抖动”且“不稳定”。

这是一个至要的区别。前两个助手测量的是距离(这离已知的车有多远?)和能量(这看起来像已知的事物吗?)。而新的敏感度解码器测量的是不稳定性。它在问:“当看向这个物体时,AI自己的大脑是否在颤抖?”

它们是如何协同工作的

研究人员构建了一个拥有三个并行“头”(解码器)共同工作的系统:

  1. 语义头(The Semantic Head): 识别已知事物(路、车、人)。
  2. 对比头(The Contrastive Head): 检查事物在全局上是否奇怪(是否远离已知模式)。
  3. 敏感度头(The Sensitivity Head): 检查局部的、细粒度的奇怪之处(纹理瑕疵、抖动的激活)。

这三个头共同投票。如果敏感度头说:“哇,这个纹理很抖动!”而另外两个头也不确定,系统就会将该区域标记为“未知”或“异常”。

结果:捕捉瑕疵

团队在两个著名的驾驶数据集上测试了他们的新型三头大脑:Cityscapes(城市街道图像集合)和 BDD-Anomaly(充满了意外障碍物,如碎片或奇怪车辆的图像)。

结果令人振奋。通过添加这个“敏感度解码器”,该系统在不产生混淆的情况下,更好地识别了那些奇怪的事物。

  • BDD-Anomaly 数据集上,他们的方法将异常检测能力提升了 2.4%(通过 AUROC 衡量,这是一个衡量系统寻找异常好坏的分数)。
  • 它还降低了“误报率”(即将正常事物误认为奇怪事物的概率)达 2.5 个百分点
  • 至关重要的是,它在实现这些改进的同时,识别正常汽车和道路的能力与旧模型一样出色。

最棒的部分是?这个新的“敏感度解码器”极其轻量化。它为模型增加的参数不到 100 万个(不到总脑容量的 3.6%)。这就像是在一个巨大的机器人身上安装了一个微小且极其灵敏的耳朵,而没有让机器人变慢。它能以 24 帧/秒 的速度运行,足以满足实时驾驶的需求。

这意味着什么

论文表明,通过添加一个寻找局部不稳定性(local instability)的第三层“敏感度”,我们可以让AI更擅长发现未知事物。作者认为,这种方法迈出了坚实的一步,因为它不需要向AI展示数百万个各种可能奇怪事物的例子。相反,它教会了AI在数据看起来“摇摆不定”时,去信任自己的“直觉”。

虽然论文并未声称已经永久解决了开放世界视觉问题,但它证明了这种特定的“敏感度”技巧是一个强大的工具。它证明了有时,为了寻找未知,你不仅需要更努力地观察宏观图景;你还需要倾听音乐中那些细微的结巴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →