← 最新论文
💻 computer science

Multi-view Patch Inference with Frozen DINOv3 for Industrial Anomaly Detection

本文提出了一种用于工业异常检测的框架,该框架结合了用于克服边界信息丢失的冻结 DINOv3 骨干网络与多视图补丁推理策略,以及用于建模正常特征分布的多尺度重构融合 Transformer,在多个基准数据集上实现了最先进的性能。

原作者: Chaoqun Wang, Wenjing Zhang, Bo Qi, Xiaoyu Huang, Ning He

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaoqun Wang, Wenjing Zhang, Bo Qi, Xiaoyu Huang, Ning He

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名工厂的质量检测员,但你不是用肉眼观察传送带,而是使用一个超级聪明的机器人大脑来发现螺丝、芯片或织物上的微小划痕、裂纹或奇怪的凸起。目标是在不需要先给机器人展示一百万张破损物品图片的情况下,识别出这些“异常”(缺陷)。

长期以来,最优秀的机器人大脑(被称为视觉 Transformer)表现出色,但它们有一个棘手的盲点。想象一下,机器人通过将图像切分成正方形网格块(就像填字游戏一样)来观察图像。如果一个小划痕恰好位于两个方块之间的分界线上,机器人可能会完全忽略它,因为它试图分别理解每个方块的“整体图像”。这就像试图通过只看每块砖中心的方式来寻找人行道的裂缝;如果裂缝正好在边缘,你可能会直接走过去。

核心理念:“重叠注视”
由王超群(Chaoqun Wang)及其团队领导的作者们决定用一种被称为**多视图补丁推理(Multi-view Patch Inference, MVPI)**的巧妙技巧来修复这个盲点。

他们不再将图像切分成一个整齐的网格,而是让机器人多次观察同一张图像,但每次都稍微移动网格的位置。这就像拍摄一幅画,先拍一张,然后向左移动一点点再拍一张,再向右移动一点点再拍一张。现在,第一种视角中位于方块边缘的微小划痕,在第二种视角中就安全地处于方块的正中心了。机器人观察所有这些重叠的视图并结合其发现。这样一来,任何缺陷都不会再被困在“盲点”线上。

“无记忆”大脑
通常,这些机器人需要携带一个巨大的“正常”图像库(记忆库)来进行对比。这既笨重又缓慢。作者们认为,你并不需要携带这个沉重的图书馆。相反,他们使用了一个被冻结的、预训练的大脑——DINOv3。你可以把 DINOv3 想象成一个天才艺术生,他已经见过数十亿张图像,知道什么是“正常”,而无需携带实体的相册。

他们冻结了这个大脑(使其不再学习新事物以免产生混乱),并仅利用它来提取特征。然后,他们使用了一个轻量化工具,称为多尺度重建融合 Transformer(Multi-scale Reconstruction Fusion Transformer, MRFT)。这个工具尝试根据天才大脑所看到的景象,重建出“正常”版本的图像。如果机器人尝试重建一个完美的螺丝,但实际图像上有划痕,那么重建出的图像在该处会显得模糊或错误。重建结果与“完美”重建版本之间的差异越大,该处存在缺陷的可能性就越高。

他们的发现(以及没能发现的)
团队在三个不同的工业图像集上测试了这一想法:

  1. MVTec AD:一个包含 15 个类别(如瓶子、电缆和皮革)的标准测试集。
  2. BTAD:一个包含真实世界工厂噪声和照明问题的集合。
  3. UltraChip:一个极其困难的集合,包含半导体芯片上的微观缺陷,且背景噪声非常大。

结果:

  • 在 UltraChip 数据集上:他们实现了 81.9% 的平均图像级 AUC。这是一个衡量机器人区分良品芯片与劣品芯片能力的得分。他们发现这优于 URD 和 SuperSimpleNet 等其他顶尖方法。
  • 在 MVTec AD 数据集上:他们在图像级检测方面得分为 99.5%,在像素级检测(精准定位缺陷位置)方面得分为 99.2%。这击败了 Dinomaly 和 Subspace 等强有力的竞争对手。
  • 在 BTAD 数据集上:他们保持了持续的优势,平均 图像级 AUC 为 97.3%

他们明确反对的做法
论文反对使用存储数千个图像特征的沉重且复杂的记忆库,指出这些记忆库既昂贵又缓慢。他们也反对依赖单一的图像分块网格,并证明这种方法会漏掉边界处的缺陷。他们并非凭空猜测,而是进行了测量。例如,他们展示了在“螺丝”类别中使用单一网格会导致得分下降,而使用他们的重叠视图则提升了得分。

他们有多确定?
作者对这些数字非常有信心,因为他们是在真实的基准数据集上进行测试,而非仅仅在模拟环境中。他们指出,虽然与其它方法相比,他们的方法是“轻量级”的,但使用庞大的 DINOv3 大脑仍需要一定的计算能力,因此无法做到瞬间完成。有趣的是,论文提到,他们的方法在 UltraChip 数据集上展现出了极具前景的零样本泛化行为,这表明通过冻结视觉 Transformer 进行多视图特征聚合可以隐式地捕捉可迁移的常态先验知识。然而,作者谨慎地澄清,他们目前的框架仍然是在传统的单类训练范式下运行,这意味着目前仍需要为不同的产品类别训练单独的模型,而不是开箱即用的真正零样本系统。这一观察为未来将框架扩展到零样本或少样本场景提供了一个有趣的探索方向。

总结
通过让机器人从多个重叠的角度观察图像,并利用一个聪明的预训练大脑来识别不协调之处,该团队创造了一个比以往方法更能发现细微、棘手缺陷的系统。这就像是给检测员戴上了一副眼镜,通过微调焦点确保没有任何裂缝被忽视,同时还让检测员的背包足够轻便,以便快速奔跑。

该系统的代码已开放供所有人查阅,作者计划继续致力于使其运行得更快,并能同时处理更多不同类型的产品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →