Don't Collapse Your Features: Why CenterLoss Hurts OOD Detection and Multi-Scale Mahalanobis Wins
本文介绍了 GOEN,一种简单高效的分布外检测流程,它通过利用多尺度特征和马氏距离,在性能上超越了最先进基线方法,同时证明了中心损失尽管提升了分类准确率,却因扭曲了可靠认知不确定性估计所需的特征几何结构而显著损害了分布外检测能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一台机器人识别十种特定的动物:猫、狗、马、鸟,等等。你给它展示成千上万张图片,直到它成为分类这些动物的专家。但是,当你给机器人展示一张烤面包机、一朵云,或者一个完全虚构的怪物的图片时,会发生什么呢?
这就是分布外(Out-of-Distribution, OOD)检测的问题。在现实世界中,我们需要人工智能能够说“我不知道这是什么”,而不是在实际上面对烤面包机时,却自信地猜测它是猫。如果人工智能无法区分这两者,它可能会犯下危险的错误。
本文介绍了一种名为GOEN(几何优化认知网络,Geometry-Optimised Epistemic Network)的新方法,旨在帮助人工智能识别何时它正在面对新事物。作者发现了一个令人惊讶的秘密:试图让人工智能内部的“知识地图”过于完美,实际上会使其在识别未知事物方面变得更差。
以下是他们发现的要点,使用了简单的类比进行解析:
1. “完美”簇的陷阱(CenterLoss 问题)
通常,在训练人工智能时,研究人员会尝试让每个动物群体(猫、狗等)的特征紧密地聚集在一起。他们使用一种称为CenterLoss的工具,将这些群体挤压成整齐、紧凑的球体。其逻辑是:“如果所有的猫都挤在一个紧密的球里,所有的狗都在另一个球里,那么人工智能的识别将非常准确。”
令人惊讶的是: 作者发现,虽然这使人工智能在识别猫和狗方面变得更好,但在识别烤面包机方面却变得更差。
- 类比: 想象一个图书馆,你强迫所有关于“历史”的书挤在一个小小的架子上,所有关于“科学”的书挤在另一个小小的架子上。现在,如果有人拿来一本关于“科学史”的书,它无法整齐地放入任何一个架子。因为架子被挤得太紧,这本书最终落在了正中间,看起来既像历史书又像科学书。人工智能会感到困惑,心想:“哦,这一定是一本历史书”,即使它实际上是一个新事物。
- 结果: 通过停止这种“挤压”(即移除 CenterLoss),知识群体得以稍微展开。这在群体之间创造了更多空间,使得人工智能更容易看到何时某物落入了空白区域(即“未知”区域)。
2. 纵观全局与关注细节(多尺度特征)
为了识别未知事物,人工智能需要同时以两种方式观察事物:
- 纹理(第 2 层): 观察笔触、颜色和颗粒感。这有助于它注意到一张图片看起来像街道标志(SVHN 数据集),而不是卡通动物。
- 含义(第 4 层): 观察整体形状和概念。这有助于它意识到“狐狸”不是“狗”。
类比: 想象试图识别一个陌生人。如果你只看他们的脸(含义),你可能会忽略他们穿着戏服。如果你只看他们的鞋子(纹理),你可能会忽略他们是谁。GOEN 会同时观察这两者。论文表明,仅使用“脸”或仅使用“鞋子”会使人工智能在识别冒牌货方面效率降低。
3. “现实世界”测试(校准)
在人工智能学会了识别动物之后,研究人员给它进行了一场特殊的“期末考试”,让它学会说“我不知道”。
- 他们向它展示高斯噪声(电视屏幕上的雪花点)。这很容易被识别为“奇怪”的东西。
- 关键在于,他们还向它展示了真实的、棘手的例子(例如来自不同数据集的门牌号)。这些看起来有点像动物,但实际上是不同的。
- 类比: 如果你只教保安识别石头(容易),他们可能会忽略穿着石头戏服的人(困难)。通过让保安在“石头戏服”(即棘手的例子)上进行训练,他们学会了怀疑那些看起来熟悉但感觉不对的事物。
4. 制胜公式
作者将这些想法结合成一个流程:
- 不要把群体挤得太紧。 让“猫”和“狗”群体拥有一些呼吸空间。
- 同时关注细节和宏观画面。
- 使用真实、棘手的例子来训练“我不知道”按钮,而不仅仅是随机噪声。
结果
当他们用这种新方法(GOEN)与其他著名的人工智能安全方法进行测试比较时:
- GOEN 正确识别未知输入的比例达到了 94.8%。
- 排名第二的方法(Deep Ensembles)仅达到 88.3%。
- 其他方法如 KNN 和 ODIN 的得分更低。
核心启示
本文的主要信息是对人工智能研究人员的一个警告:仅仅因为人工智能擅长分类已知事物,并不意味着它善于了解自身的局限。
事实上,试图让人工智能的内部知识过于完美(过于紧凑)可能会使其对未知事物视而不见。通过让知识群体拥有呼吸空间,并使用现实世界中棘手的例子来训练人工智能,我们可以构建出更安全、更诚实地面对自身未知领域的系统。
整个系统的速度也非常快,在单台计算机上不到 20 分钟即可完成训练,使其成为现实世界安全应用的实用工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。