Pixel-Level Pavement Distress Assessment Using Instance Segmentation
本文提出了一种基于 Mask R-CNN 的实例分割系统,用于精确的像素级路面病害评估,该系统在自定义现场采集数据集上的定位精度和裂缝总面积估算方面优于 YOLO 检测,同时突出了标注一致性和类别不平衡方面的关键挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名道路检查员。你的工作是发现路面上的裂缝、坑洞和损坏,以便城市能在它们变成巨大的坑洼之前进行修复。过去,你必须步行街道,眯着眼睛查看沥青路面,这在靠近交通的地方既缓慢、疲惫又危险。
本文讲述的是如何构建一个数字检查员,它利用摄像头和智能计算机大脑自动完成这项工作。以下是他们如何构建它以及发现了什么的经过。
问题:为什么“框选”不够用
研究人员解释说,早期的计算机程序尝试通过两种方式发现道路损坏:
- “是/否”检查:观察一小块方形路面,并判断“这里是否有裂缝?”(这有助于知道是否存在问题,但无法准确知道具体位置)。
- “框选”方法:在裂缝周围画一个方形框。这就像试图用方形礼品盒包裹一条长而蜿蜒的蛇。盒子虽然覆盖了蛇,但也覆盖了大量空白区域,且无法告诉你蛇的确切形状或实际长度。
对于道路维护,你需要知道损坏的确切形状和总面积,以计算修复成本。方形框对于细长的分支裂缝来说过于笨拙。你需要一种能像荧光笔一样,逐像素地追踪裂缝的工具。
解决方案:“数字荧光笔”(实例分割)
团队构建了一个名为Mask R-CNN的系统。将其想象为一个超级智能的数字荧光笔。它不仅能找到裂缝,还能:
- 勾勒出完美的轮廓,跟随每一个转折。
- 精确计算有多少像素的路面受损。
- 区分真正的裂缝与看起来像裂缝的事物,如油污、阴影或路面标线。
他们在一个新创建的名为UWGB-STREETCRACK的数据集上测试了该系统。他们驾驶一辆车,将 iPhone 15 Pro Max 安装在车头,录制当地道路的视频。随后,他们手动为四种类型的损坏绘制了精确的多边形轮廓:
- 纵向裂缝:与道路平行延伸。
- 横向裂缝:横跨道路延伸。
- 龟裂:相互连接的裂缝网(像蜥蜴的皮肤)。
- 坑洼:路面上的深坑。
实验:谁赢得了比赛?
研究人员将他们的“数字荧光笔”(Mask R-CNN)与另外两种计算机视觉模型进行了较量:
- “画框者”(YOLO):一种快速检测器,仅绘制方框。
- “裁剪切割者”(DeepSegmentor):一种模型,只有当你先从图片中手动裁剪出裂缝后才能工作。
结果:
- 获胜者:Mask R-CNN(特别是带有"ResNet-101"大脑的版本)是当之无愧的冠军。
- 它在发现裂缝方面极其准确(召回率 90%),并且非常善于避免错误(精确率 84%)。
- “面积”测试:这是最令人印象深刻的部分。测试照片中的实际受损面积为2.170%。Mask R-CNN 估算的面积为2.164%。差异不到百分之一!它几乎完美。
- 失败者:“画框者”(YOLO)表现糟糕,得分极低。它无法很好地处理混乱的现实道路状况。
- “裁剪切割者”:虽然如果你给它一张干净、裁剪好的图片,它能估算裂缝面积,但在观察整个道路场景时却失败了,因为它被阴影和路面标线搞糊涂了。
挑战:它仍在何处跌倒
尽管该系统非常出色,但作者承认它尚未完美。他们在现实世界中发现了几个“故障”:
- 混淆的视觉效果:有时计算机会将长条油污或标线误认为是裂缝。
- “井盖”之谜:井盖周围的区域很棘手。计算机有时无法判断盖附近的线条是裂缝还是金属盖的一部分。
- “龟裂”谜题:当存在巨大的裂缝网时,人类可能会争论:“这是一个巨大的裂缝还是五个小裂缝?”计算机有时给出的猜测与人工标注者不同。这表明绘制线条的规则需要非常严格。
结论
本文证明,实例分割(即“数字荧光笔”)是我们目前用于自动测量道路损坏的最佳工具。它不仅发现了裂缝,而且以几乎与人类专家完全一致的精度进行了测量。
作者总结道,虽然该系统已准备好成为估算需要修复道路数量的实用工具,但我们仍需努力使数据标注的“规则”更加清晰,以免计算机被阴影或污渍搞糊涂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。