想象一下,你正在教一个机器人园丁识别生病的苹果树叶。你给它展示了成千上万张健康叶片、患疮痂病的叶片、患锈病的叶片等图片。这个机器人在这项任务上变得非常擅长。但是,当机器人看到一张它从未见过的花朵、汽车或纹理图案的图片时,会发生什么呢?
这就是分布外(OOD)检测的问题。在现实世界中,机器人不应该仅仅进行猜测;它们应该能够说:“我不知道这是什么。”
本文利用一个真实的苹果病害数据集,系统地测试了六种不同的方法,旨在教导机器人在遇到陌生事物时说“我不知道”。以下是用通俗语言进行的分解:
问题:过度自信的机器人
大多数人工智能模型的训练方式就像学生参加多项选择题考试。即使问题毫无意义(例如,当考试主题是苹果时,问“火星的首都是什么?”),学生也被迫选择一个答案。他们可能会仅仅因为必须选某个答案,就以 99% 的置信度猜“华盛顿特区”。
在人工智能中,这被称为Softmax 基线。模型被迫将其 100% 的“置信度”分配给已知的病害。因此,当它看到一朵花时,可能会自信地说:“那肯定是一片患锈病的叶子!”这是危险的,因为机器人认为自己知道答案,而实际上它一无所知。
实验:测试六种“安全网”
研究人员测试了六种不同的方法来解决这种过度自信问题,从简单的调整到复杂的训练策略。他们使用了三种类型的“陌生”图片来测试机器人:
- 汽车:与叶片非常不同(容易识别)。
- 纹理:只是图案,没有物体(容易识别)。
- 花朵:看起来与叶片非常相似(难以识别)。
以下是这六种方法的表现:
- 基线(Softmax):机器人过度自信。它未能识别出花朵,误以为它们是患病的叶片。
- 独立分类器:与其强迫机器人选出一个获胜者,不如给它五个独立的“是/否”按钮(每种病害一个)。如果没有任何按钮亮起,机器人就知道这是一个未知物体。这是一个令人惊讶的、简单且有效的解决方案。
- “已知的陌生人”(OOD 类别):他们明确教导机器人一个名为“未知”的第六类别。这效果完美,但不切实际,因为在现实世界中,你并没有一个标有“未知”事物的盒子在事前展示给机器人。
- 异常值暴露:他们在训练期间向机器人展示了“奇怪的东西”(如汽车)的图片,并告诉它:“如果你看到这些,请保持不确定。”这有所帮助,但机器人仍然会被花朵搞糊涂。
- 基于能量的微调(获胜者):这种方法改变了机器人对图片的“感觉”。它不再仅仅选择一个获胜者,而是计算一个“能量分数”。
- 正常叶片具有低能量(它们感觉熟悉且平静)。
- 奇怪的东西(如花朵)具有高能量(它们感觉混乱且陌生)。
- 结果:这种方法效果最好。它不仅改变了评分规则,还实际上重组了机器人内部的“大脑地图”(嵌入空间),使得奇怪的事物自然地漂移得远离已知病害。它比其他方法更能区分叶片和花朵。
- 野数据优化(WOODS):这是最现实的方法。它假设机器人已部署在田间,并开始收集一堆随机照片(有些是叶片,有些是花朵,有些是岩石),且没有标签。它试图从这堆杂乱的数据中学习。
- 难点:虽然这是最现实的场景,但它也是最难训练的。涉及的数学计算不稳定。研究人员不得不添加“刹车”(惩罚权重的上限),以防止训练崩溃。它比基线方法效果更好,但很难调校到位。
论文的关键要点
- 现实性与性能:那些假设我们在训练期间拥有完美的“陌生”数据来展示给机器人的方法效果最好。但在现实世界中,我们没有这些数据。“基于能量”的方法取得了最佳平衡:它在不需要标记“陌生”数据的情况下表现优异。
- 花朵问题:论文发现,对于人工智能来说,花朵实际上比汽车更难被拒绝。尽管人类认为汽车与叶片完全不同,但人工智能的内部数学有时发现汽车比花朵更难区分。这表明,对我们来说看起来“不同”的东西,对计算机来说并不总是看起来“不同”。
- 训练不稳定性:当尝试在中等规模的真实世界数据集上使用最先进的方法(如 WOODS)时,训练过程非常脆弱。设置的微小变化会导致模型崩溃。这是一个实际问题,而简单的计算机基准测试(使用微小、完美的数据集)往往忽略了这一点。
- 准确率未下降:人们主要担心的是,教导机器人说“我不知道”会使它在识别实际病害方面变得更差。论文发现事实并非如此。机器人在识别患病叶片方面保持同样出色,同时在识别陌生人方面变得更好。
结论
你可以教导人工智能保持谦逊,承认自己不知道某些事情,即使是在像农业这样复杂、现实世界的工作中。这里发现的最佳方法是使用“基于能量”的评分,它重塑了人工智能看待世界的方式,使陌生事物与已知事物保持距离。然而,目前最先进的方法就像高性能赛车:它们效果很好,但对如何调校引擎非常敏感。
技术摘要:超越玩具基准——植物病害分类中分布外检测方法的系统评估
问题陈述
计算机视觉领域的深度学习系统在基准任务上已展现出卓越的性能,但其“封闭世界”假设阻碍了它们在现实场景中的可靠部署。基于 Softmax 目标优化的标准分类流程,迫使概率质量在已知类别间分配,导致模型对无关输入(分布外数据,OOD)赋予高置信度。尽管关于 OOD 检测的文献浩如烟海,但大多数方法仅在小型、视觉同质化的数据集(如 CIFAR-10/100)上进行评估,未能捕捉现实部署的复杂性。具体而言,这些基准往往缺乏特定领域应用(如农业)中常见的语义变化、协变量偏移以及“近 OOD"案例(例如视觉相似但类别不同的情况)。本文通过在Plant Pathology 2021 数据集上评估各种方法,填补了理论 OOD 检测与实际应用之间的空白;该数据集涉及苹果叶片病害分类的细粒度任务,其中自然分布偏移(如花朵、非植物物体、遮挡)普遍存在。
方法论
本研究对六种 OOD 检测方法进行了系统评估,从简单的后处理评分到复杂的约束优化,并在训练期间对 OOD 数据访问的不同假设下进行了测试。实验采用在 5 类苹果病害子集(15,675 张图像)上微调的 ResNet-18 骨干网络。
实验设置
- 分布内(ID)数据:五个单标签病害类别(黑星病、健康、轮纹病、锈病、白粉病)。
- 分布外(OOD)数据:三个具有不同语义距离的外部数据集:
- Stanford Cars:远 OOD(无视觉重叠)。
- 可描述纹理数据集(DTD):远 OOD(结构差异)。
- Flowers102:近 OOD(与叶片视觉相似,代表关键失效模式)。
- 辅助数据:ImageNet-O 用于训练期间需要标记 OOD 数据的方法。未标记的“野生”数据(ID 和 OOD 的混合)用于约束优化方法。
评估方法
- E1:Softmax 基线:标准交叉熵训练。OOD 得分为负的最大 Softmax 概率。
- E2:独立二分类:用五个独立的 Sigmoid 输出替换 Softmax 头,并使用二元交叉熵(BCE)进行训练,以消除 Softmax 的零和竞争。
- E3:显式 OOD 类:增加一个第六个输出类别作为 OOD,在标记的 ID 和 OOD 数据上进行训练。作为近似上界。
- E4:异常值暴露(OE):利用辅助损失对基线分类器进行微调,该损失鼓励在标记的 OOD 数据(ImageNet-O)上产生均匀预测。
- E5:基于能量的 OOD 检测:
- E5a(后处理):使用 logits 的自由能(E(x)=−Tlog∑efc(x)/T)作为评分函数,无需重新训练。
- E5b(能量微调):使用基于边界的能量整形损失对模型进行微调,以显式分离 ID 和 OOD 的能量分布。
- E6:WOODS:一种约束优化框架,在未标记的“野生”数据(ID 和 OOD 的未知混合)上进行训练,无需假设可访问干净的标记 OOD 数据。它在满足 ID 误报率和分类精度约束的前提下,最小化被分类为 ID 的 OOD 样本比率。
关键结果
评估揭示了现实农业环境中 OOD 检测的几个关键见解:
- 性能层级:E5b(能量微调) 成为最强的实用方法,在所有 OOD 数据集(包括具有挑战性的 Flowers102 近 OOD 数据集)上实现了最高的 AUROC 和最低的 FPR95,且无需在初始训练阶段使用标记的 OOD 数据。
- 基线改进:
- E2(独立 BCE) 显著优于 Softmax 基线(E1),尽管未使用任何 OOD 数据,这表明移除 Softmax 归一化是一种强大且低成本的改进。
- E5a(后处理能量) 相比 E1 提供了即时增益,证实了能量分数本身是优于 Softmax 概率的指标。
- 近 OOD 挑战:与直觉相反,在所有方法中,“远 OOD"数据集(Stanford Cars)并不总是比“近 OOD"数据集(Flowers102)更容易检测。这凸显了感知相似性并不总是与特征表示难度相关。
- 嵌入空间分析:对嵌入空间的定性分析(通过计算与 5 个最近邻的余弦距离)显示,E5b 显著重塑了特征空间,增加了 ID 和 OOD 分布之间的分离度(Wasserstein 距离从 E1 的 0.02 增加到 E5b 的 0.07)。这表明收益既来自更校准的评分函数,也来自重新组织的嵌入空间。
- 分布内稳定性:在所有方法中,ID 测试集上的平衡准确率保持稳定(范围 0.916–0.944),表明 OOD 感知训练并不一定会降低任务性能。
实际挑战与不稳定性
本文记录了将约束优化方法扩展到中等规模数据集(约 1 万张图像)时出现的显著训练不稳定性,这一发现在现有文献中大多缺失:
- 学习率敏感性:对于 E4、E5b 和 E6,学习率是最关键的超参数。过高的学习率会导致 OOD 损失过早占据主导,从而破坏分类性能。
- WOODS 不稳定性:WOODS 中使用的增广拉格朗日法(ALM)被证明高度敏感。使用标准超参数的初始尝试导致惩罚权重无限增长,致使验证准确率下降 20%。实现稳定需要降低对偶学习率、放宽约束容差,并引入惩罚权重的硬性上限——这一修改在原 WOODS 公式中并不存在。
意义与主张
作者声称,在现实世界的特定领域数据上实现原则性的 OOD 检测是可行的,但标准的基准评估往往无法捕捉部署过程中出现的实际挑战。
- 超越基准:本研究证明,在小型、同质化基准上表现优异的方法可能无法直接转化为复杂的农业环境,特别是在近 OOD 检测和训练稳定性方面。
- 实际可行性:基于能量的微调(E5b)被提出作为一种稳健的实用解决方案,它在保持高检测性能的同时,满足了初始训练期间不需要标记 OOD 数据的操作约束。
- 实施现实:本文强调,理论框架(如 WOODS)需要谨慎的、特定于数据集的工程调整(例如超参数调优、惩罚截断),才能在中等规模数据集上稳定运行,这一细微差别在以大规模或合成基准为重点的文献中常被忽视。
这项工作为旨在将 OOD 检测部署到标准基准之外的从业者提供了参考,强调虽然 OOD 感知训练是可行的,但在现实世界背景下,它需要严格关注训练动态和超参数稳定性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。