想象一下,你正在教一个机器人识别不同类型的动物。你给它看了成千上上的张猫、狗和鸟的照片,它学会了非常有信心地说:“那是一只猫!”但如果突然给机器人看一张烤面包机或云朵的照片会发生什么呢?由于机器人从未见过这些东西,它可能仍然会自信满满地大喊:“那是一只猫!”因为它正试图将新图像强行归入它已知的类别中。这是一个重大的 AI 安全问题。我们需要一种方法,让机器人能够说:“等等,我不知道这是什么,”而不是错误地猜测。这就是“分布外”(Out-of-Distribution, OOD)检测的挑战:即弄清楚何时数据是全新的、且与 AI 训练时所用的数据完全不同的。
为了解决这个问题,科学家们经常研究 AI 用来做决策的“特征”。你可以把这些特征看作是机器人在给出答案之前,对图像所做的内部笔记或草图。一些研究人员曾尝试使用固定的规则来调整这些笔记,比如“如果一个数字太大,就把它减小”。但这些规则通常只是基于特定测试中有效经验的猜测,当机器人看到真正奇怪的东西时,它们可能会失效。大问题在于:我们能否找到一条数学规则,能够精确地告诉我们如何针对任何类型的新数据来调整这些笔记,而不仅仅是针对我们见过的特定例子?
这篇论文引入了一种结合了数学和信息论的新方法来思考这个问题。作者提出了一种理论,将这些内部笔记的调整视为一个灵活的、随机的过程,而非固定规则。他们使用了一个数学“损失函数”(衡量 AI 表现好坏的计分卡),该函数试图同时完成两件事:首先,它将新奇、陌生数据的笔记尽可能地推离熟悉数据的笔记;其次,它利用“信息瓶颈”(Information Bottleneck)的概念,确保这些笔记不会变得过于混乱,或者丢失识别异常情况所需的关键细节。
基于这些发现,作者建议使用一种名为“分段线性函数”(Piecewise Linear Function, PLF)的新型灵活工具。你可以把它看作是一个智能且可调节的过滤器,它可以以恰到好处的方式弯曲并塑造 AI 的内部笔记,从而识别出各种类型的各种新数据。当他们在多种标准测试(包括带有棘手图像失真的测试以及全新的类别)上测试这个新过滤器时,它的表现优于目前几乎所有现有的方法。事实上,在对 21 种不同检测方法的庞大对比中,他们的新方法在所有测试中都排名前三,这表明对于在遇到未知情况时保持 AI 的诚实性,这是一个更加可靠且通用的解决方案。