The Signal in the Noise: OOD Detection Through Goodness-of-Fit Testing in Factorised Latent Spaces
本文介绍了“噪声中的信号”(SITN),这是一种新颖的分布外检测方法,它利用连续归一化流的特性,在因子化潜在空间中识别非典型的噪声映射,从而在无需分布外数据且不产生显著计算成本的情况下,克服了传统基于似然的指标不可靠的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人,它花费数年时间研究一种特定类型的艺术,比如印象派绘画。它确切地知道一幅“正常”的印象派绘画是什么样子的:笔触、色彩、光线在画布上的投射方式。
现在,你给机器人看一张现代涂鸦墙的图片。机器人需要做出判断:“这是一幅印象派绘画(分布内数据),还是完全不同的东西(分布外数据)?”
旧问题:“自信的谬误”
长期以来,科学家们试图通过让机器人计算“似然分数”来解决这个问题。这个分数回答的是:“这张图像由我的训练过程生成的可能性有多大?”
正如这篇论文所指出的,问题在于机器人经常会被欺骗。
- 如果你给它看一张简单的空白画布(在机器人眼中,这技术上属于印象派绘画),它可能会给它打高分,因为它“简单”且易于解释。
- 如果你给它看一张复杂、混乱的涂鸦墙,它可能会给它打低分。
- 但关键在于:如果你给它看一张猫的图片(这绝对不是一幅印象派绘画),机器人可能会意外地给它比空白画布更高的分数,仅仅因为猫具有一些视觉特征(如边缘或颜色),在机器人的数学运算看来显得“简单”。
机器人被复杂性搞糊涂了。它会想:“这看起来很简单,所以一定是真的”,即使它实际上是假的。这被称为复杂性偏差。
新方案:“噪声中的信号”(SITN)
作者,来自爱丁堡大学的 Philipp Bomatter 及其团队,提出了一种思考该问题的新方法。他们使用了一种名为**连续归一化流(CNF)**的特殊人工智能。
把这种人工智能想象成一个魔法翻译器。
- 训练:该人工智能学习将真实的印象派绘画翻译成一种特定类型的“静态噪声”(就像老式电视在没有信号时看到的雪花噪点)。它学习到,每一幅真实的画作,无论多么复杂,都应该被翻译成这种特定的、随机的静态噪点模式。
- 逆向:因为这种翻译是完美的(从数学角度而言),该人工智能也能将静态噪点翻译回画作。
“拟合优度”测试
这是他们新方法SITN的巧妙之处:
他们不再问“这幅画的可能性有多大?”,而是问:“如果我将这张图像翻译成静态噪点,这个噪点看起来像真实的电视雪花噪点吗?”
- 真实画作(分布内数据):当人工智能将其翻译回静态噪点时,结果看起来像完美、随机的电视雪花噪点。像素之间相互独立,并遵循随机性的规则。
- 虚假图像(分布外数据):当人工智能试图将涂鸦墙或猫翻译成静态噪点时,结果看起来很怪异。
- 也许噪点带有某种不该存在的奇怪图案(如棋盘格)。
- 也许“噪声”过于平滑或过于粗糙。
- 这种“静态噪点”不符合随机性的规则。
论文将这种现象称为“噪声中的信号”。尽管图像已被转化为噪声,但原始虚假图像的结构会在噪声中留下一个“信号”,从而将其暴露出来。
他们如何检查噪声
作者使用两个简单的测试来查看“噪声”是否真实:
- “形状”测试:噪声看起来是否像完美的钟形曲线(随机噪声的标准形状)?如果噪声过于平坦或过于尖锐,那就是假的。
- “友谊”测试:在真实的随机噪声中,一个像素不应该关心它的邻居。它们是完全的陌生人。如果噪声显示像素之间是“朋友”(相关的)或遵循某种模式,那就是假的。
如果噪声未能通过这两项测试中的任何一项,人工智能就会说:“这不是一幅真实的画作;它是分布外数据。”
为什么这更好
论文声称,该方法在以下三个方面优于其他方法:
- 它忽略复杂性:它不在乎图像是简单还是复杂。它只关心“噪声”看起来是否正确。这解决了机器人被简单假象欺骗的问题。
- 它速度快:它不需要运行额外的、缓慢的计算,也不需要训练第二个机器人来辅助决策。
- 它严格:它可以在数学上保证,在观察真实事物时不会过于频繁地大喊“假的!”。你可以设定一条规则,例如“只将 100 个真实事物中的 1 个标记为假”,它就会遵守这条规则。
结果
该团队在标准图像数据集(如 CIFAR-10,包含汽车、动物和飞机的微小图片)上测试了这种方法。
- 当他们向机器人展示SVHN(街道号码)或CelebA(名人面孔)的图片作为“假象”时,旧方法(似然性、典型性)感到困惑,经常将假象称为“真实”,或将真实事物称为“假象”。
- SITN 始终一致地正确识别出了假象。
- 他们甚至测试了带有伪影(如模糊、雪花或运动模糊)的图像。SITN 在识别这些伪影方面最为一致,而其他方法在伪影改变了图像“复杂性”时则失败了。
一个小瑕疵
作者诚实地指出了一个小弱点。有时,如果图像有一大块纯色(如大片蓝天),人工智能的翻译器很难将该色块转化为“随机静态噪点”。它会留下微弱的图案。这有时会误导系统,使其认为真实图像是假的。然而,作者指出这是一个罕见的边缘情况,总体而言该方法表现非常出色。
总结
简而言之,这篇论文介绍了SITN,一种不再试图猜测图像“可能性”大小的方法。相反,它将图像翻译成“噪声”,并检查该噪声是否看起来像真实的、随机的静态噪点。如果噪声中存在隐藏的模式(即“信号”),那么该图像就是假的。这是一种更聪明、更快速、更可靠的方法来识破人工智能的冒牌货。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。