PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images
PADFormer 是一种新颖且高效的图像空间法,用于进行与姿态无关的异常检测,它利用视觉 Transformer 通过跨视图掩码重构和集成推理,从稀疏视图中重构无异常图像,在无需计算昂贵的 3D 重构的情况下实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名工厂的质量检测员,但你不是站在固定的工作站前,而是漂浮在一个由成千上万个微小零件组成的巨大旋转雕塑周围。你的任务是发现一个划痕或一颗缺失的螺栓。问题在于?雕塑正在旋转,有时是倒置的,有时是侧着的,或者用其他部件遮挡住了自己的一部分。在计算机视觉的世界里,这就是异常检测(Anomaly Detection)的挑战:教计算机仅通过“完美”物品的照片来寻找缺陷。通常情况下,计算机就像僵硬的机器人;它们期望物体每次都处于完全相同的姿态。如果你展示一个正面的完美杯子,它们能发现正面的裂纹。但如果你展示一个侧面有裂纹的杯子,且拍摄角度很奇怪,机器人就会感到困惑,因为它从未见过这个角度下的杯子。这就是姿态无关异常检测(Pose-Agnostic Anomaly Detection)——一个高级说法,意思是:“无论物体如何扭转或翻转,计算机都能找到损坏的部分吗?”
长期以来,解决这一问题的唯一方法是构建物体的完整3D全息图。想象一下,你需要从各种可能的角度拍摄数百张玩具照片,并将它们输入到超级计算机中以构建虚拟3D模型,然后旋转该模型以匹配新照片,从而观察哪里出了问题。这确实有效,但就像为了找一颗小石子而试图用沙堡盖一座房子一样;它耗时极长,需要海量数据,而且极其昂贵。这项研究背后的研究人员提出了一个更简单的问题:如果我们根本不需要3D模型呢?如果我们能在当前的2D图像中,“想象”出这个奇怪角度下的完美物体是什么样子呢?
于是有了 PADFormer,一种像超级强力的艺术修复师一样的新方法。它不构建3D模型,而是观察几张完美物体的照片(例如2到10张图像)以及一张可能损坏的新照片。然后,它使用一种特殊的AI——视觉Transformer(Vision Transformer)(可以把它想象成一个将图像视为微小拼图块的大脑)来进行一场“填空游戏”。计算机获取新照片,遮住其中随机的图块(就像在画作上贴上便利贴),然后仅利用它所见过的“完美”照片来重新绘制这些缺失的部分。因为它仅在完美物体上进行了训练,所以它不知道如何画出损坏的部分。因此,当它尝试填充便利贴覆盖的部分时,它会画出那个位置的“完美”版本。如果原始照片中有划痕或缺失件,计算机的绘画看起来就会与真实照片不同。通过对比两者,计算机能瞬间识别出缺陷,即使物体处于它从未见过的扭转状态。
论文证明了这种方法在效率方面是一个游戏规则的改变者。虽然旧方法需要数百张照片和复杂的3D重建才能工作,但 PADFormer 仅需极少数的参考图像(少至2张)即可达到最先进的效果。在 MAD-SIM 和 PIAD 等数据集的测试中,PADFormer 的表现显著优于以往的方法。例如,在“2-shot”(使用两张参考图像)的情景下,它的图像级准确率得分达到了 78.8,而排名第二的方法为 57.9。它还能在像素级定位缺陷,得分高达 89.2,大幅领先竞争对手。作者展示了这不仅适用于奇怪的角度,也适用于物体处于固定位置的标准任务,证明了其方法的通用性。
其“秘密武器”在于 PADFormer 如何处理这些“拼图块”。它不仅仅是观察整幅图,还使用了一种**动态图块选择(Dynamic Patch Selection)机制。想象一下你在修复一张撕裂的地图。你不是看整张地图,而是找到另一张地图中与之完美契合的特定角落,即使那张地图是旋转过的。PADFormer 在数学上也这样做,在尝试填充之前,将“完美”的参考图块与“损坏”的查询图块进行对齐。它还使用了一个由异常无关标记(Anomaly-Agnostic Tokens)**组成的特殊“记忆库”——这些是关于全局和局部“正常”状态的学习提示——以帮助它即使在物体倒置时也能猜出正确的形状。
至关重要的是,论文排除了对3D重建的依赖。作者认为,构建3D模型的繁重工作是不必要的,而且在无法为每件物品拍摄数百张照片的现实工厂环境中往往是不切实际的。他们还表明,虽然其他方法在物体完美对齐时可能表现良好,但在视角变化时会表现得很糟糕。然而,PADFormer 专为这种混乱而设计。它不只是猜测,而是学习直接在2D空间中重建“理想”版本的图像。
在实验中,研究人员发现 PADFormer 不仅准确,而且速度很快。通过多次运行重建过程(具体为使用不同的随机掩码进行 15次迭代)并取平均值,系统确保覆盖了图像的每一寸。他们还发现,在一种被称为 CIELAB 的特定色彩空间(模拟人类眼睛观察色彩的方式)中测量原始图像与重建图像之间的差异,比使用标准的 RGB 色彩更有效。这使得他们能够捕捉到其他方法可能会错过的细微缺陷,如微小的污渍或毛刺。
论文总结道,PADFormer 弥合了高科技3D方法与简单2D图像处理之间的鸿沟。它表明,我们不需要为了寻找一个坏掉的玩具而去构建一个虚拟世界;我们只需要一位足够聪明的艺术家,他知道从各个角度看去,完美的玩具应该是怎样的。虽然该方法存在局限性——例如需要多次迭代才能获得完整的图像,并且在面对非常大的异常情况时可能表现吃力——但它代表了一个重要的进步。它证明了凭借正确的“想象力”,计算机可以识别出那些奇特的和损坏的事物,无论世界如何旋转。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。