Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models
本文提出了一种利用预训练视觉 - 语言模型进行分布外检测的新方法,该方法通过引入去偏采样的理论框架来解决负标签挖掘中的假阴性问题,并实际采用蒙特卡洛采样实现,从而达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《去偏负采样提升预训练视觉 - 语言模型的分布外检测》的通俗解释,辅以日常类比。
大局观:AI 的“陌生人危险”问题
想象你有一位非常聪明的保安(AI 模型),他受过训练,能够识别 1,000 种特定的动物(如猫、狗和鹰)。这位保安在识别这些动物方面表现出色。然而,在现实世界中,保安可能会遇到一种他从未见过的全新动物,比如鸭嘴兽或机器狗。
如果这位保安过于自信,他可能会强行将鸭嘴兽归类为“鸭子”或“海狸”,这就犯了错误。这被称为**分布外(OOD)**错误。本文的目标是教导这位保安如何说“我不知道这是什么”,而不是胡乱猜测。
当前的解决方案:“非此即彼”的清单
为了帮助保安识别陌生人,研究人员开始使用一种名为**视觉 - 语言模型(VLM)**的特殊工具。你可以把这个工具想象成一位不仅能看到动物,还知道成千上万种其他动物名称的保安。
目前流行的方法运作如下:
- 保安观察未知的动物。
- 他将该动物与1,000 种已知动物(分布内或 ID)进行比较。
- 他还将该动物与从字典中挑选的一长串随机动物(负标签)进行比较。
- 如果未知动物看起来更像“随机列表”而非“已知列表”,保安就会将其标记为陌生人。
问题所在: 当前方法使用一个简单的规则来选择这些“随机动物”(负标签):“挑选那些听起来或看起来与已知动物不同的词。”
- 缺陷: 这就像试图通过挑选不是“狗”的词来寻找“非狗”。你可能会不小心选中“狼”或“狐狸”。对 AI 来说,狼看起来很像狗。因此,AI 会感到困惑。它会想:“好吧,这个新动物看起来像狼,而狼在我的‘非狗’列表中,所以这一定是狗!”
- 结果: AI 会犯错,因为它的“陌生人列表”中混杂了实际上看起来像它本该认识的东西。这被称为负采样偏差。
本文的解决方案:“去偏”侦探
本文的作者说:“我们需要一种更好的方法来挑选我们的‘陌生人’列表,而不会不小心选中那些看起来像我们朋友的东西。”
他们开发了一种数学技巧,无需人工检查列表中的每一个词即可修正这种偏差。以下是他们的方法,使用了一个类比:
类比:嘈杂的广播电台
想象你试图收听一首特定的歌曲(“真正的陌生人”信号),但你的收音机正在接收静电干扰和其他歌曲(“野生语料库”或未标记数据)。
- 旧方法: 你只是调大静电的音量,希望你想听的歌曲足够响亮以脱颖而出。有时静电会淹没歌曲,或者你会将一首听起来相似的歌曲误认为你想要的歌曲。
- 新方法(去偏负采样): 作者意识到,“静电”(野生数据)实际上是两种东西的混合:
- 与你的已知朋友相似的事物(正噪声)。
- 真正陌生的事物(负噪声)。
与其猜测哪个是哪个,他们使用了一种数学减法技巧。
- 他们估算混合中有多少“类朋友”的噪声。
- 他们从总静电中数学地减去这种“类朋友”的噪声。
- 剩下的就是“真正陌生人”实际样貌的更清晰信号。
在技术术语中,他们使用了一种称为重要性采样的技术。他们利用杂乱无章的未标记数据,并通过数学方法修正其中某些数据看起来太像已知类别的事实。这就产生了一个“去偏”分数。
他们是如何做到的(三个步骤)
本文概述了一个实用的三步流程,以构建这个更好的“陌生人检测器”:
- 挑选最佳的“陌生人”: 他们取了一个巨大且杂乱的单词字典(野生语料库)。他们不是随机挑选,而是挑选那些最“密集”或聚集在一起的词。这就像挑选最具代表性的“陌生”示例,而不是随机的异常值。
- 模拟“朋友”: 由于他们没有“真正朋友”的列表可供减去,他们创建了一个虚假列表。他们在计算机内存中,将已知的动物名称(例如“猫”)添加一点点“噪声”(随机性)。这模拟了“朋友”在杂乱数据中的样子。
- 数学魔法: 他们将这两个列表代入公式。他们计算未知动物的分数,然后从杂乱的“陌生人”分数中减去模拟的“朋友”分数。这消除了混淆。
结果:为何重要
作者使用著名的图像数据集(如 ImageNet)测试了这种新方法与旧方法。
- 结果: 他们的方法始终优于之前的最佳方法。
- 证明: 在测试中,当展示奇怪图像时,他们的 AI 更擅长说“我不知道”,并且不太可能自信地猜错动物。
- 鲁棒性: 即使“已知”动物略有不同(例如是绘画而非照片),或者使用不同类型的 AI 大脑,该方法依然表现良好。
总结
本文修复了 AI 学习识别“未知事物”时的一个特定缺陷。旧方法就像试图通过忽略干草来在干草堆中寻找针,但却不小心捡起了其他看起来相似的针。新方法使用数学过滤器去除那些“假针”,让 AI 能更清晰地看到什么是真正未知的。这使得 AI 在遇到从未见过的事物时更加安全和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。