在现代工厂静谧的嗡鸣声中,产品离开生产线前的最后一步通常是人工用肉眼扫描缺陷。这种人工检查过程缓慢、昂贵,且容易受到人类疲劳导致的不稳定性影响。为了解决这个问题,工程师们长期以来一直试图教会计算机像人一样识别缺陷,即使用通过学习损坏部件实例来进行学习的软件。但问题在于:在一个运行良好的工厂里,几乎所有东西都运作得非常完美。缺陷品极其罕见,以至于试图从中学习的计算机能研究的样本非常之少。由于缺乏足够的样本,软件会变成一个差生;它可能会在错误判断时表现得十分自信,或者无法识别出它从未见过的某种新型缺陷。研究人员的目标不仅是建造一台能“看”的机器,还要建造一台知道自己何时“不确定”的机器,以便它只在必要时才向人类寻求帮助。
来自希腊、德国和荷兰的研究小组通过开发一种用于检查电动剃须刀金属机身的新系统,向这一目标迈出了重要一步。他们的工作解决了两个问题:一是缺乏足够的坏样本进行学习,二是产生自信错误(误判)的危险。他们提出了一个类似于精细过滤器的三步流程。首先,系统将剃须刀主体从背景中分离出来。接着,它会检查物体本身是否看起来正常,而无需确切知道可能存在哪种类型的缺陷。最后,如果发现缺陷,系统会尝试识别具体的缺陷类型,但增加了一个关键环节:它会计算自己对答案的确定程度。如果系统缺乏信心,它会将该物品标记给人工检查员,而不是冒险做出错误的决定。
为了解决由于真实缺陷剃须刀过少而导致无法训练软件的问题,研究人员使用了一种名为“扩散模型”的强大工具。可以将它想象成一位数字艺术家,这位艺术家研究了少量的真实损坏剃须刀,并学会了如何绘制出从未存在过的、逼真的新缺陷图像。通过生成数百个这类合成缺陷,他们能够教会分类软件去识别那些原本会被忽略的模式。他们在三种常见的印刷错误(污渍、断线和指纹)上测试了这种方法。结果表明,向软件输入这些计算机生成的示例,显著提高了其在针对少量实际损坏剃须刀进行测试时,识别和分类真实缺陷的能力。
他们创新的第二部分在于软件如何处理不确定性。团队对比了两种教计算机衡量自身置信度的不同方法。一种被称为“深度集成”(deep ensemble)的方法,是将同一张图像通过五个略有不同的软件版本运行,并取其答案的平均值。另一种是“贝叶斯”(Bayesian)方法,它通过修改软件的内部结构,来模拟针对每一张看到的图像所产生的各种可能答案。两种方法都表现良好,但贝叶斯方法在了解自己何时正确方面表现得尤为出色。在小样本数据测试中,贝esian系统表现出了更高的校准度,这意味着它的内部置信度得分比另一种方法更符合其性能的实际情况。当系统感到不确定时,它能正确地识别出这种不确定性,从而提供了一条路径,让机器处理简单的案例,并将棘手的案例交给人类专家。
研究人员还测量了该系统的运行速度,这对于无法承受减速的工厂生产线来说是一个关键因素。从隔离剃须刀到做出最终决策,整个过程每件产品耗时不到一秒。虽然由于执行更复杂的置信度计算,贝叶斯方法比深度集成法稍慢,但总时长仍然足够快,可以满足实际应用的需求。这项研究表明,通过将合成数据生成与一个了解自身局限性的系统相结合,制造商可以构建出既准确又可靠的检测工具。这项工作仍在进行中,团队计划很快在实时生产线上测试完整的系统,但初步研究结果为未来机器与人类协作确保质量、消除过去瓶颈的愿景提供了一个充满前景的蓝图。
技术摘要:数据匮乏背景下值得信赖的制造视觉质量检测
问题陈述
自动化视觉检测在制造业面临着两个影响经济可行性和可靠性的关键障碍:数据匮乏和决策不可靠。
- 数据匮乏: 在优化的生产线上,绝大多数产品是非缺陷品。因此,标记过的缺陷样本非常稀少,这限制了通常需要大量训练数据的监督学习型检测器的性能。
- 决策不可靠: 标准分类器通常只输出“硬标签”,而不提供置信度估计。这造成了不对称的成本结构:误判(假拒)会浪费合格产品,而漏判(假接)则会导致缺陷产品流入市场。此外,在有限数据上训练的模型可能会对分布外(out-of-distribution)的缺陷进行自信的错误分类,使制造商无法区分可靠预测与不确定预测。
方法论
作者提出了一个阶段式检测流水线,该流水线集成了合成数据生成、无监督异常检测以及具备不确定性感知能力的分类。该系统分为两个阶段运行:离线训练阶段和在线推理阶段。
1. 合成缺陷生成(离线)
为了解决数据匮乏问题,作者利用了基于 Stable Diffusion v1.5 的双支路扩散模型 DualAnoDiff。
- 机制: 与传统的图像修复(inpainting)不同,DualAnoDiff 在单次去噪过程中同时生成异常物体的全局视图和隔离缺陷区域的前景视图。两个分支共享注意力机制,以确保生成的异常与生成的掩码(mask)之间保持一致性。
- 训练: 该模型使用极少量真实样本(总计 50 张图像)针对每种缺陷类型(指纹、断续印刷、污迹)进行微调。根据 IC-LPIPS 和 KID 指标相对于训练池的表现来选择最佳检查点。
- 输出: 针对每种缺陷类别,生成 500 张合成图像及相应的像素级对齐掩码,以扩充训练数据集。
2. 无监督异常检测(在线)
流水线首先使用 Mask R-CNN 进行感兴趣区域(ROI)分割,以将剃须刀底座从背景中分离出来。
- 模型: 采用 EfficientAD 进行异常检测。它仅在无缺陷样本上进行训练,因此对缺陷数据的稀缺具有鲁棒性。
- 功能: 它使用轻量级的学生-教师架构结合自动编码器来检测偏离常态的现象。它输出一个标量异常得分和一个像素级热力图。
- 逻辑: 得分低于阈值的单元被接受为无缺陷。被标记的单元进入分类阶段。该阶段与具体的缺陷分类法无关,仅关注异常的存在及其位置。
3. 带有不确定性估计的缺陷分类(在线)
对于被标记为异常的单元,系统会对缺陷类型进行分类并量化其不确定性。研究对比了两种方法:
- 深度集成(Deep Ensembles): 使用五个使用不同随机种子独立训练的 EfficientNet-B3 模型。不确定性源于集成成员之间的分歧(方差)。
- 贝叶斯神经网络(BNN): 采用经过修改的 EfficientNet-B3 架构来逼近 BNN。前层保持确定性以进行稳定的特征提取,而深层则利用 Flipout 层在正向传播过程中对权重应用伪独立扰动。
- 不确定性类型: 系统估计了偶然不确定性(观测噪声)和认知不确定性(模型知识缺乏)。高认知不确定性会触发“推迟(defer)”动作,将模糊的单元路由至人工审核,而不是强行进行可能错误的自动化决策。
核心贡献
- 阶段式流水线架构: 一种创新的集成方案,结合了 ROI 分割、无监督异常检测(EfficientAD)以及具备不确定性感知的分类,旨在应对生产线的特定约束。
- 关于合成数据的实证研究: 在极端数据匮乏的情况下,评估了基于扩散模型的合成缺陷生成(DualAnoDiff)在真实生产缺陷上的表现,展示了其对分类和定位性能的影响。
- 不确定性感知分类: 在低数据量环境下,对用于缺陷分类的深度集成和贝叶斯神经网络进行了对比分析,评估了其预测性能、校准度以及识别用于人工干预的分布外样本的能力。
实验结果
研究针对飞利浦电动剃须刀底座的图像进行,重点关注三类缺陷:指纹、污迹和断续印刷。实验是在包含极少量真实样本(每类 10–15 个)并辅以合成数据的训练集上进行的。
- 分类性能:
- 在二分类任务(指纹 vs. 污迹)中,深度集成和贝叶斯模型在小型真实测试集(16 张图像)上均达到了完美准确率 (1.000)。
- 在三分类任务中,随着训练数据增加(每类 500 张合成图像),贝叶斯方法表现优于深度集成,实现了更高的准确率 (0.833 vs. 0.750) 和 F1 分数 (0.830 vs. 0.709),以及更优的 AUROC (0.977 vs. 0.930)。
- 校准与不确定性:
- 贝esian 分类器展现出显著更好的校准度,在二分类任务中,其 Brier 分数和期望校准误差(ECE)比深度集成降低了多达两个数量级。
- 认知不确定性: 在二分类任务中,由于其在小型且具有代表性的测试集上随机正向传播的高度一致性,贝叶斯模型报告了接近零的认知不确定性。相反,深度集成由于模型间的分歧报告了非零的不确定性。
- 偶然不确定性: 在二分类任务中,随着训练数据的增加,偶然不确定性通常会下降,这表明对固有类别模糊性的校准得到了改善。
- 系统延迟:
- 由于 BNN 的蒙特卡洛采样带来的计算开销,深度集成提供了较低的延迟 (0.0629s 用于分类) 和较高的吞吐量 (15.90 img/s),而贝叶斯方法则相对较慢 (0.5073s, 1.97 img/s)。
- 尽管存在贝叶斯方法的额外开销,但整个流水线的总延迟(约 1.0s)仍适用于在线生产线的部署。
重要性与主张
作者将这项工作定位为一项关于初步结果的进展报告。他们主张:
- 合成增强结合不确定性感知分类可以降低在数据匮乏环境下开发值得信赖且可部署的检测模型的成本。
- 所提出的流水线实现了选择性人工干预。通过仅将不确定的预测推迟给人类专家,该系统在保留自动化带来的劳动力节省的同时,减轻了误判/误接的风险。
- 该方法弥合了高精度需求与有限缺陷数据现实之间的鸿沟,为实现“值得信赖”的自动化提供了一条路径,即系统能够知道自己何时“不知道”。
未来的工作包括评估端到端的在线流水线,并实现一个反馈循环,使分布外单元能够触发少样本生成和针对新缺陷类型的重新训练。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。