想象一下,你正在雇佣一名保安来在光亮且复杂的金属表面上发现微小的划痕。这是一项艰巨的工作,因为金属表面布满了天然凸起、漩涡和反光,它们看起来与划痕非常相似。
问题:“错误学校”的训练
通常,为了训练计算机完成这项工作,我们会使用一种称为“预训练”的方法。这相当于让计算机在开始其具体工作之前,先上一所普通学校。
- 旧方法: 大多数计算机是在海量的日常照片库(如猫、汽车和风景)上进行训练的。这就像把你的保安送去一所公园护林员学校。他们学会了识别树木和动物,但当他们到达金属工厂时,却感到困惑。这所“学校”(ImageNet)并没有教他们钢板上划痕的样子。
- 失败的替代方案: 一些研究人员尝试仅在无标签的工厂照片上训练计算机。但这就像告诉保安:“只看这些金属板,然后找出哪里出了问题。”在没有老师指出划痕的情况下,计算机会被闪亮的纹理和噪声分散注意力,无法学会什么是真正的缺陷。
解决方案:“异常引导”
本文的作者们创造了一种新的训练方法,称为AGSSP(异常引导的自监督预训练)。他们意识到,计算机需要一份特定的“小抄”来知道该看哪里。
以下是他们的两步训练营是如何运作的:
第一步:“热力图”老师(骨干网络预训练)
首先,他们使用一种智能工具(称为KeAD)扫描了数千张无标签的金属照片。这个工具不需要人工标记每一个划痕。相反,它使用了一种“少样本”技巧:你给它展示几个划痕的例子,它就会利用其对语言和图像的知识,推测其他划痕可能在哪里。
- 比喻: 想象一位老师在金属照片上绘制出淡淡的、发光的热力图。红色斑点显示计算机可能发现缺陷的位置。
- 训练: 随后,他们训练计算机的“大脑”(骨干网络)将注意力集中在这些发光的红色斑点区域。即使热力图并不完美,它也教会了计算机不再忽视那些奇怪的斑点,而是开始关注它们。
第二步:“方框”训练师(检测器预训练)
一旦大脑被训练成看向正确的位置,他们就需要教计算机如何围绕缺陷画出一个方框。
- 比喻: 利用第一步中的相同热力图,他们自动在可疑区域周围绘制了边界框。他们告诉计算机:“把这些方框当作真实的缺陷来处理。”
- 训练: 计算机练习围绕这些“伪缺陷”画框。这确保了当它最终开始真正的工作时,它已经知道如何框定缺陷,而不仅仅是寻找它们。
结果:超级强化的保安
作者在包含 12 万张工业图像的巨大数据集(他们能找到的同类中最大的数据集)上测试了这种方法。
- 结果: 当他们在真实的金属缺陷数据集上测试这些新“毕业生”时,他们彻底击败了竞争对手。
- 数据: 与旧的“公园护林员”模型(在 ImageNet 上训练)相比,他们的新模型将准确率提高了高达10% 到 11%。在最困难的场景下(可供学习的示例极少),改进更为显著,有时甚至将成功率提高了一倍。
- 通用性: 这种方法在不同类型的金属(钢管、铸造坯料)甚至非金属表面(如织物)上都表现良好,证明了“热力图”策略是发现缺陷的通用钥匙。
一言以蔽之
与其猜测缺陷长什么样,或者在错误类型的数据上进行训练,本文赋予计算机一个智能、自动化的指南(异常图),该指南突出了问题所在。通过首先教导计算机关注这些斑点,然后教导如何框定它们,他们创造了一个更敏锐、更可靠的缺陷检测器。他们还公开了所有数据和代码,以便其他人可以利用这份“小抄”来构建更好的工业检查员。
技术摘要:通过异常引导预训练推进金属表面缺陷检测
1. 问题陈述
金属表面缺陷检测对于工业质量控制至关重要,但由于数据稀缺和高变异性,面临严峻挑战。在现实场景中,例如钢管生产,缺陷往往占每日图像的比例不足 0.1%,导致极端的类别不平衡和高昂的数据收集成本。
现有解决方案面临“关键困境”:
- 自然图像预训练: 在大规模自然数据集(如 ImageNet、COCO)上预训练的模型,应用于工业图像时存在显著的领域差距。
- 朴素自监督学习 (SSL): 应用于域内工业数据的标准 SSL 方法(对比学习或重建)往往失效。现有的学习目标难以从复杂的背景噪声、纹理和变化的光照中区分细微、低对比度的缺陷模式。因此,在没有特定指导的情况下单纯扩大域内数据集,产生的结果次优,有时甚至不如 ImageNet 基线。
- 检测器初始化: 大多数 SSL 方法仅预训练模型主干网络,而检测头(neck 和 head)仍保持随机初始化。这种不匹配会损害性能,特别是在数据稀缺的场景中。
2. 方法论:异常引导自监督预训练 (AGSSP)
作者提出了 AGSSP,这是一种新颖的两阶段预训练范式,利用异常先验显式地引导表示学习。该框架在大规模无标签工业数据集(12 万张图像,61 个类别)上运行,包含三个核心组件:
A. 知识增强型异常检测 (KeAD)
为了在不依赖人工标注的情况下生成必要的监督信号(异常图),作者开发了 KeAD,这是一种基于少样本、多模态 WinCLIP 模型的无监督方法。
- 提示工程: 与通用提示(如“损坏”)不同,KeAD 使用由 GPT-4o 生成并经专家知识细化的详细、特定缺陷的文本描述(例如,“一张带有{缺陷类型}缺陷的{物体}照片,其表现为{缺陷特征}")。
- 视觉增强: 为了改善空间定位,该方法集成了 Clip Surgery(V-V 注意力),在注意力机制中将查询(Query)和键(Key)组件替换为值(Value)组件。这比 WinCLIP 的滑动窗口方法更有效地捕捉局部空间信息。
- 输出: KeAD 生成像素级异常热力图(零样本和少样本模式),指示潜在的缺陷区域。
B. 阶段 1:异常图引导的主干网络预训练 (AGBP)
该阶段将从生成的异常图中蒸馏出的知识融入模型主干网络。
- 蒸馏损失: 主干网络的高级特征图与异常图进行对齐,对于 ViT 架构使用 L2 损失,对于异构架构(如 ResNet)使用余弦距离损失。
- 策略: 低级特征保留自标准的 ImageNet 预训练模型(因为它们捕捉通用模式),而高级特征则由异常图引导,以聚焦于缺陷显著区域。
- 集成: 该蒸馏损失 (Ldistill) 通过加权求和 (Ltotal=Ldistill+λLtask) 与现有的预训练任务(如分类、MoCov3、SimMIM)相结合。
C. 阶段 2:异常框引导的检测器预训练 (AGDP)
该阶段通过使用源自异常图的伪标签对检测头进行预训练,以解决检测头的不匹配问题。
- 伪框生成: 识别具有高异常分数的图像。采用动态阈值策略(针对每个物体类别自适应调整)将异常图转换为二值掩码。提取连通分量,并保留异常分数最高的前 10 个边界框作为伪缺陷标签。
- 训练: 检测器(neck 和 head)在这些伪框上进行训练,同时主干网络保持冻结。这使得模型能够学习“异常物体”的概念,并使检测组件与下游任务对齐。
3. 主要贡献
- AGSSP 框架: 一种两阶段预训练范式,利用异常图在整体上对齐主干网络表示和检测器任务对齐,显著提升了数据稀缺环境下的性能。
- KeAD 方法: 一种知识增强型异常检测技术,利用详细的缺陷描述和 V-V 注意力生成高质量的异常图以进行引导预训练,实现了强大的少样本性能。
- 大规模数据集: 收集并发布了一个包含 12 万张图像、涵盖 61 个类别的大规模无标签工业数据集,以及两个用于验证的小规模像素级标注金属表面缺陷数据集(铸坯和钢管)。
- 全面验证: 广泛的实验表明,AGSSP 在多种主干网络(CSPDarknet、ResNet、Swin-Base)和检测器(YOLOv8、Faster R-CNN、DINO)上均优于 ImageNet 和 COCO 基线。
4. 实验结果
作者在四个金属表面缺陷数据集(铸坯、钢管、GC10-Mini、GC10-DET)和一个非金属数据集(织物缺陷)上评估了 AGSSP。
- 性能提升: AGSSP 一致地提高了检测指标。与基于 ImageNet 的模型相比,其 mAP@0.5 最高提升了 10%,mAP@0.5:0.95 提升了 11.4%。
- 少样本学习: 在极端少样本场景(铸坯-Mini50,50 个训练样本)中,与 SimMIM 基线相比,AGSSP 带来了巨大的增益,mAP@0.5 提升了 +41.0%,mAP@0.5:0.95 提升了 +24.5%。
- 跨域泛化: 在非金属织物缺陷数据集上,AGSSP 将性能提升了 +3.2%(mAP@0.5)和 +5.2%(mAP@0.5:0.95),证明了其强大的泛化能力。
- 消融研究:
- KeAD: 详细的缺陷描述和 V-V 注意力显著提高了异常检测精度(例如,钢管上的图像级 AUROC 达到 93.5%)。
- 预训练策略: 同时预训练主干网络和检测器(AGSSP)的表现始终优于仅预训练主干网络(AGBP)或标准 SSL 方法。
- 效率: 该方法保持了实时推理能力(例如,带有 AGSSP 的 YOLOv8s 达到 94.5 FPS),同时匹配或超过了更大模型(如 YOLOv12s)的精度。
5. 意义与主张
本文主张 AGSSP 解决了当前工业缺陷检测预训练策略中固有的领域差距和目标不匹配问题。通过统一、异常引导的方法显式地引导模型聚焦于异常区域,该方法能够在预训练阶段无需昂贵的边界框标注的情况下,学习到鲁棒的、与领域相关的表示。
作者强调,虽然标准的域内 SSL 通常因无法区分细微缺陷与噪声而失效,但其异常引导方法成功地将模型的注意力引导至缺陷显著特征。该框架被提出为与架构无关,并能与现有的专用架构集成,为数据稀缺且不平衡的工业质量控制提供了一种可扩展的解决方案。
可用性: 所有代码、预训练模型和数据集均在论文提供的项目页面上公开可用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。