← 最新论文
💻 computer science

Unified Multi-Layer Subspace Modeling for Cross-Domain OOD Detection

本文介绍了 PRISM,这是一种与模型无关的后验方法,它通过将多层特征统一为一个单一的分层嵌入,并结合类条件马氏距离与残差能量来检测分布外输入,从而以单一默认配置和极低的推理开销实现了最先进的跨域性能。

原作者: Gerhard Krumpl, Henning Avenhaus, Horst Possegger

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Gerhard Krumpl, Henning Avenhaus, Horst Possegger

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能在识别模式方面已变得异常出色。当向其展示数千张猫、狗或汽车的照片时,这些系统能够高精度地识别出这些特定物体。然而,一个根本性的缺陷仍然存在:这些系统往往过于自信。如果你向一个训练好的猫识别器展示一张烤面包机的照片,系统可能不会简单地说“我不知道”,而是可能会自信地宣布:“这是一只非常奇怪的猫。”这是因为该系统仅针对猫进行了训练;它对于训练集之外的内容没有任何概念。在医疗影像或工业安全等高风险领域,这种错误是危险的。如果一个系统因为假设异常情况只是已知物体的某种奇特变体,从而自信地误诊患者或漏掉机器零件上的裂纹,可能会导致无声且灾难性的失败。该领域研究人员的目标是构建一种安全机制,使其能够可靠地识别出输入内容是否属于系统从未见过的类别。

多年来,科学家们一直试图通过观察这些神经网络的内部运作来解决这个问题。这些网络通过许多层来处理图像,就像剥洋葱一样。早期层检测简单的特征,如边缘和颜色,而深层则识别复杂的形状和物体。现有的识别未知输入的方法大多仅依赖于其中的一层。有些方法只看网络做出的最终决策,另一些则检查最终步骤之前的特征。问题在于,没有哪一层对于所有情况都是完美的。有时,早期层能提供关于图像异常的最佳线索;而其他时候,深层则更具代表性。由于“最佳”层会根据图像类型和具体问题的不同而变化,因此仅选择一层的方法在移动到新环境时往往会失效。其他方法尝试结合来自多个层的信号,但它们通常需要一个校准步骤,即利用它们本应检测到的那些“未知数据”的样本来进行调优。这造成了一个悖论:为了构建一个检测未知的探测器,你首先需要看到未知的样本,这使得该工具失去了作为通用安全工具的意义。

在一项新的研究中,研究人员提出了一种名为 PRISM 的方法,它通过将整个网络视为一个统一的整体,而非一系列分离的层,从而避免了这些陷阱。PRISM 不再试图挑选值得信任的某一层,也不再是对几层的得分进行平均,而是同时收集网络浅层、中层和深层的信息。它将这些不同的视角缝合在一起,形成对图像的一个综合表示。研究人员随后使用一种统计技术,在这一合并空间内描绘出“正常”数据的形状。他们建立了一个模型,用以描述当通过所有这些层同时观察时,典型的已知图像呈现出怎样的形态。当新图像到达时,系统会检查两点:首先,它测量该图像在合并空间中距离已知数据中心的距离;其次,它检查该图像是否具有指向系统从未见过的方向的特征,本质上是在测量有多少图像特征是无法被已知模式所解释的。

研究人员在各种现实场景中测试了这种方法,包括自然照片、医疗扫描(如 MRI 和内窥镜视频)以及工业检测任务。他们将 PRZISM 与二十二种其他最先进的方法进行了对比。结果显示,PRISM 始终优于其他方法,在所有这些不同领域中都实现了最高的平均准确率,且无需针对每个领域进行专门调优。至关重要的是,它仅使用来自已知“分布内”数据的样本即可实现,不需要任何未知样本来校准其设置。虽然其他方法在特定领域(如医疗影像)表现良好,但在应用于工业照片或自然场景时往往会遇到困难。相比之下,PRISM 在任何地方都能保持强劲的表现。研究还发现,该方法几乎不会增加计算机的处理时间,使其在实际应用中具有可行性。

这项工作的核心发现是,检测未知最可靠的方法不是寻找单一的“最佳”层,也不是依赖于预先调优的组合,而是将网络的整个深度融合为一个连贯的视图。通过同时建模所有层中已知数据的几何结构,系统能够对不同数据集的特定特性具有鲁棒性。研究人员证明,这种方法消除了困扰现有方法的这种不稳定的校准步骤。他们表明,当你不再试图猜测网络哪一部分最重要,而是让整个网络同时发声时,你会得到一个更加一致且可靠的探测器。这表明,对于安全至上的应用场景而言,未来的路径在于统一的多层建模,这种建模尊重数据的完整复杂性,而不是通过仅观察网络的某一个切片来简化问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →