Tippett-minimum Fusion of Representation-space Diffusion Models for Multi-Encoder Out-of-Distribution Detection
本文介绍了 EncMin2L,这是一个参数高效且与编码器无关的框架,它通过统计双层最小门控融合表示空间扩散模型,从而在不依赖分布外标签的情况下,实现对多种分布偏移类型的鲁棒分布外检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名博物馆的保安。你的工作是在真正的杰作(分布内,或ID图像)中识别出赝品(分布外,或OOD图像)。
问题在于,“赝品”有各种各样的形式。有些是完全不同风格的画作(比如在古典画廊里出现的一幅现代抽象作品)。有些主题正确但纹理错误(比如一张看起来像画作的猫的照片)。还有些只是真实艺术品的模糊或噪点版本。
如果你只依赖一位专家来检查每一幅画,你肯定会漏掉一些赝品。
- 一位精通艺术史的专家可能会发现风格不匹配,但会漏掉模糊的照片。
- 一位精通纹理的专家可能会发现模糊的照片,但会将风格不匹配误认为是新的艺术潮流。
- 一位精通语义(物体是什么)的专家可能会发现奇怪的动物,但会漏掉损坏的图像。
本文介绍了一种名为EncMin2L的新型安保系统。它不是雇佣一位超级专家,而是雇佣一个由三位不同专家组成的团队,并运用一条巧妙的规则来综合他们的意见。
三位专家(编码器)
该系统使用三个预训练的 AI“编码器”,它们以不同的方式观察图像:
- CLIP:“大局观”专家。它理解图像的整体氛围和语言。它非常擅长识别图像是否属于完全不同的世界(比如在自然画廊里出现的一张街景照片),但很容易被模糊或带噪点的图像所欺骗。
- DINOv2:“细节”专家。它观察微小的图像块,并确切理解物体是什么。它非常擅长识别“猫”是否实际上是“狗”,但它被训练为忽略噪声,因此经常漏掉模糊或损坏的图像。
- ResNet-50:“纹理”专家。它观察底层的像素和模式。它最擅长识别图像是否被损坏、模糊或带有噪点,但有时会漏掉物体本身发生的细微变化。
“一个超级大脑”的问题
作者尝试构建一个巨大的 AI,让它同时查看三位专家的笔记(即“单体”模型)。但这就像强迫一个通才成为所有领域的专家。它不仅需要2.3 倍的计算机算力(参数),而且效果仍不如团队方案。由于不同专家看待世界的方式不同,这个模型感到困惑。
解决方案:“最坏情况”警报系统
作者创建了一个名为EncMin2L(编码器最小 2 级)的两步投票系统。其工作原理如下,使用一个简单的类比:
第一步:个人警报(第 1 级)
每位专家观察图像并给出一个“怀疑分数”。
- 如果图像模糊,纹理专家会大喊“赝品!”
- 如果图像风格怪异,大局观专家会大喊“赝品!”
- 如果图像是错的动物,细节专家会大喊“赝品!”
系统取每位专家从两种不同视角观察图像所得分数的最低(即最可疑)值。这就好比:“如果我的两只眼睛中任何一只看到了问题,我就会担心。”
第二步:团队磋商(第 2 级)
现在,系统审视这三位专家。它问道:"此刻谁最担心?"
它取所有三位专家中最低(即最可疑)的分数。
- 如果图像模糊,纹理专家最担心,因此系统听从他们的意见。
- 如果图像风格怪异,大局观专家最担心,因此系统听从他们的意见。
神奇规则:系统不需要预先知道图像是哪种赝品。它只需等待团队中那位最警觉的专家举旗。只要团队中任何人高度怀疑,该图像就会被标记为赝品。
他们如何在不看到赝品的情况下决定雇佣谁
最酷的部分是,作者在不曾见过任何一张赝品的情况下,就确定了该雇佣哪些专家。他们对“真实”图像进行了两项简单的测试:
- “类别测试”():他们检查专家能否在真实照片中区分猫和狗。如果能,说明该专家擅长识别“错动物”类赝品。
- “模糊测试”():他们人为地模糊真实照片,观察专家是否感到困惑。如果专家对模糊非常困惑,说明该专家擅长识别“损坏”类赝品。
通过对正常数据执行这些简单测试,他们准确预测了哪位专家会在哪种类型的赝品上失效。这使得他们能够组建一支完美的团队。
结果
当他们将这支团队与最佳单一专家以及巨大的“一个超级大脑”模型进行对比测试时:
- 该团队识别出了94% 或更多的所有类型赝品(全局偏移、语义变化和纹理损坏)。
- 没有任何单一专家能独自做到这一点;他们都有盲点。
- 该团队仅使用了巨大模型不到一半的计算机算力就实现了这一目标。
总结
本文证明,你不需要一个超级智能的 AI 来识别每一种赝品。相反,你需要一个由不同专家组成的多样化团队,每位专家都有自己的盲点,并遵循一条简单的规则:"听从那个最害怕的人。"这种方法比试图构建一个单一的“完美”检测器更便宜、更快,且能捕获更多的赝品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。