每一座桥梁、每一栋建筑和每一条道路都依赖于其混凝土表层的完整性。当这层“皮肤”出现裂缝时,这往往是结构正在老化、承受过度重量或受自然元素侵蚀的首个可见迹象。如果这些裂缝未被察觉,它们会不断扩大,导致水分和碎屑渗透得更深,最终危及整个结构的安全性。几十年来,发现这些裂缝的唯一方法是依靠人类检测员的眼睛,他们通过步行穿过桥梁长度或攀爬塔架,眯着眼睛观察表面以寻找细微的裂纹。这种方法缓慢、昂贵且容易产生人为错误,因为疲劳和主观判断可能会导致即使是最资深的检测员也会错过关键缺陷。
近年来,工程师们开始转向利用计算机来协助这项任务,使用人工智能来扫描混凝土图像并识别损伤。然而,教计算机“看见”一条裂缝却出人意意地困难。为了学习,这些计算机程序通常需要成千上万个示例,其中每一条裂缝的每一个像素都必须由人工进行手动追踪。这个过程极其耗费人力,从而造成了瓶颈;研究人员往往无法收集到足够的标注数据来有效地训练他们的系统。因此,挑战在于如何构建一个既能高精度寻找裂缝,又不需要大量人力进行逐像素描绘的系统。
一位研究人员开发出一种新方法来弥补这一差距,该方法结合了两种不同类型的人工智能,以更高的准确度且极少的人力投入来检测结构裂缝。他们称之为“混合框架”的方法,首先教计算机简单地识别一张图像中是否包含裂缝,这项任务只需要一个简单的“是”或“否”的标签,而不需要详细的绘图。一旦计算机在宏观层面上理解了裂缝的样子,研究人员就会使用一种技术来突出显示使计算机做出该判断的图像特定区域。这些被突出的区域就像是损伤的一个粗略草图,随后通过数学规则进行精炼和清理,以平滑误差并连接断开的线条。
这个精炼后的草图随后被用于训练第二个更复杂的计算机模型,该模型专门设计用于绘制精确的边界。这个第二模型旨在理解裂缝的整体轮廓及其微小的细节,使其能够区分真实的裂缝与混凝土上的阴影或污渍。研究人员在收集的一组真实世界混凝土表面图像上测试了这个系统,并将其性能与现有的其他方法进行了对比。他们发现,该方法成功识别裂缝的总准确率达到了85%。更重要的是,通过依赖最初的粗略草图而非完美的人工绘图,该系统减少了39%的人工标注工作量。
结果显示,该系统在处理不同类型的损伤方面表现尤为出色,从宽大的明显裂缝到其他方法经常遗漏的极细微发丝裂纹均能应对自如。研究人员还使用了统计分析来确认计算机对其发现的置信度在不同类型的裂缝中是否保持一致,结果显示,当损伤严重时,系统的确定性最高;而当裂缝几乎肉眼难辨时,确定性最低。虽然该系统并不完美,仍需进行一些调整以应对最困难的光照条件,但它为监测我们的基础设施健康提供了一条切实可行的路径。通过使检测过程更快且更少依赖昂贵的人力劳动,这种方法可以帮助工程师更频繁地检查更多结构,确保桥梁和建筑在小裂缝演变成重大故障之前保持安全。
技术摘要:通过精细化技术实现用于精确识别与多领域结构裂缝分割的通用混合 OUR-Net-U-Net
问题陈述
土木基础设施(桥梁、建筑、路面)中的结构裂缝是潜在失效的关键指标。虽然人工检查是传统的标准,但这种方式劳动强度大、具有主观性,且在大规模应用时容易出现人为错误。基于深度学习的分割模型虽已有所改进,但通常依赖于全监督学习,这需要大量、昂贵且耗时的像素级标注。现有的弱监督方法生成的定位图往往较为粗糙,缺乏精确分割所需的边界精度。此外,许多模型在处理多样化的裂缝模式(变化的宽度、方向和对比度)时表现不佳,并且对环境噪声、光照变化和表面纹理较为敏感。
方法论
本文提出了一种弱监督框架,旨在弥合图像级分类与密集像素级分割之间的差距。该方法由一个六阶段流水线组成:
- 数据集获取: 本研究利用了一个包含 802 张图像的公开混凝土裂缝数据集,涵盖了多样化的裂缝模式、表面纹理和光照条件。数据按 80:20 的比例进行训练集和测试集的划分。
- 预处理: 图像经过缩放、归一化和数据增强(旋转、翻转)处理,以增强特征的一致性和鲁棒性。研究调查了作为基准的传统技术(如 Otsu 阈值法和边缘检测),但主要将其用于增强裂缝可见性的预处理阶段。
- 伪掩码生成(混合 U-Net): 该框架并非使用手动像素标签,而是训练一个仅使用图像级标签(有裂缝 vs 无裂缝)的 CNN 分类器。随后,利用类激活映射(CAM)和梯度加权类激活映射(Grad-CAM)生成粗略的定位热图。这些热图通过加权二项式关系进行融合,并通过空间一致性约束和形态学操作进行精细化,从而创建高质量的“伪掩码”。
- 分割(OUR-Net): 生成的伪掩码用于训练混合 OUR-Net 架构的监督。与标准 U-Net 不同,OUR-Net 利用**八度卷积(Octave Convolutions)**将特征图分解为高频成分(裂缝边缘、细微细节)和低频成分(全局结构、连续性)。这使得网络能够同时捕捉细微的发丝裂缝和较宽的结构裂缝。解码器采用八度最大下采样(OMU)来准确重建空间信息。
- 精细化: OUR-Net 的原始概率图通过阈值处理、形态学操作(腐蚀、膨胀、开运算、闭运算)进行后处理,以去除噪声并填补空隙,并通过骨架化技术将裂缝区域简化为单像素中心线,以获得更好的拓扑表示。
- 可视化: 最终的精细化掩码被叠加在原始图像上,用于结构评估。
核心贡献
- 弱监督框架: 将 CAM/Grad-CAM 与混合 U-Net 相结合以生成伪掩码,与全监督方法相比,将标注依赖性降低了约 39%。
- 混合架构: 结合了用于定位的分类主干网络和利用八度卷积处理多频率裂缝特征(包括细微和宽阔裂缝)的 OUR-Net 分割模型。
- 精细化流水线: 实现了一套综合的后处理套件,包括阈值处理、形态学操作和骨架化,以提高裂缝的连续性并去除假阳性。
- 统计验证: 通过在不同裂缝严重程度(从“极轻微”到“严重”)下使用 95% 置信区间,对模型的置信度进行了严格的统计分析。
结果
该框架使用标准指标(准确率、精确率、召回率、Dice 系数和交并比 IoU)针对最先进的弱监督和全监督模型(包括 OUR-Net-CAM、OUR-Net-GradCAM、DeepLabV3 和 SegNet)进行了评估。
- 性能: 所提出的混合 OUR-Net-U-Net 实现了 85% 的整体分类准确率(结果部分具体为 0.8489),Dice 系数为 0.72,IoU 为 0.55。
- 对比: 该模型优于其他弱监督基准模型。例如,标准的基于 CAM 的定位生成的 IoU 为 0.52,而所提方法将其提升至 0.55。
- 置信度分析: 统计分析显示,预测置信度随裂缝严重程度的增加而提高。“严重”裂缝显示出 0.8423 的平均置信度和较窄的置信区间,而“极轻微”裂缝的置信度较低(0.8199)且区间较宽,反映了检测低对比度、细微特征的固有难度。
- 标注效率: 研究强调了一种权衡,即所提方法在实现具有竞争力的性能的同时,显著减少了数据集准备的时间和成本。
意义与主张
本文主张,该框架为自动化的结构健康监测提供了一种高效且可扩展的解决方案。通过减少对昂贵像素级标注的依赖,该方法使大规模部署更具可行性。作者强调,将可解释人工智能技术(CAM/Grad-CAM)与先进分割技术(OUR-Net)相结合,有效地解决了弱监督学习中定位粗糙的问题。形态学精细化和骨架化的引入进一步增强了系统识别和量化细微裂缝的能力,而这些裂缝往往会被标准分割模型忽略。研究结论指出,虽然全监督模型由于拥有精确的地面真值(ground truth)可能在准确率上略高,但所提出的弱监督方法在检测可靠性和标注成本之间提供了实用的平衡,使其适用于大规模、自动化的结构评估。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。