← 最新论文
💻 computer science

UAD-YOLO: An Efficient Context-Aware and Shape-Aware Framework Based on YOLOv11 for Urban Anomaly Detection in Complex Scenes

本文提出了 UAD-YOLO,这是一个基于 YOLOv11 的高效框架,通过引入大可分离卷积核注意力(Large Separable Kernel Attention)、重参数化卷积(Reparameterised Convolution)和 Shape-IoU 损失,旨在实现复杂场景下高精度、实时的城市异常检测,并通过一个新数据集以及优于基准模型的卓越性能指标进行了验证。

原作者: Chen Shiying

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen Shiying

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

城市是活着的系统,不断地移动与变化,但它们依赖于稳定的维护节奏来保持安全。当道路出现裂缝、树木倒塌或标志牌损坏时,其后果可能从轻微的不便上升到严重的危险。几十年来,监测这些城市隐患一直是人类巡检员的工作,他们通过步行或驾车穿梭在街区中寻找问题。这种方法速度慢、成本高,且往往会遗漏细小或隐藏的问题。近年来,科学家们转向利用计算机来提供帮助,教它们通过摄像头来“看见”这些问题。这一被称为“目标检测”的领域,让机器能够扫描图像并识别特定物品,从汽车到路面坑洼洞。然而,教计算机在繁忙的街道上发现一条锯齿状的裂缝,要比在空旷停车场里找一辆汽车难得多。背景错综复杂,光照不断变化,而且目标本身往往是不规则的、破损的或部分被遮挡的。

来自四川交通职业技术学院研究人员的一项新研究解决了这些难题,为计算机如何观察我们的城市创造了一种更聪明的方法。该团队开发了一个名为 UAD-YOLO 的系统,专门设计用于实时发现各种类型的城市问题。该系统不仅仅是寻找看起来像标准方框的形状,而是旨在理解城市街道中混乱、复杂的现实。它可以识别七种不同类型的异常情况,包括道路裂缝、坑洼、损坏的标志、倒塌的树木、垃圾、涂鸦和断裂的电线杆。研究人员不仅依赖现有数据;他们还建立了一个新的、大型的图像集,其中包含数千个这些特定问题的实例,以此来教计算机该寻找什么。通过结合几种先进的技术,他们创造了一个既高度准确又足够快速、能在标准设备上运行的工具,这为持续的城市监测提供了一个实用的解决方案。

研究人员面临的核心挑战在于,城市异常现象并不呈现为整齐、完美的物体。一条路面裂缝可能会以细长、蜿蜒的线条延伸数米,而一堆垃圾可能是一个无定形的团块。传统的计算机视觉工具往往难以处理这些不规则形状,尤其是在它们被阴影、其他车辆或复杂的纹理等干扰物包围时。为了解决这个问题,团队修改了一个现有的强大检测框架——以速度著称的 YOLOv11。他们增加了三项特定的改进,以帮助计算机像人类观察者一样进行“思考”。首先,他们为系统提供了一种更好的观察全局的方式。通过使用一种允许计算机观察图像中远程连接的技术,它能够理解一个小裂缝与更大路面之间的关系,而不仅仅是看到一条随机的线。这有助于系统忽略背景噪音,专注于真正重要的内容。

其次,研究人员改进了计算机观察细节的方式。他们引入了一种方法,允许系统在训练阶段学习复杂的纹理,但在实际工作时简化其结构。这类似于一名学生在学习时使用大量的笔记和图表,但在考试时仅使用精简的心智地图。这种方法确保了计算机能够发现细小的细节,如微小的坑洼或浅浅的划痕,而不会减慢处理过程。第三,他们改变了计算机围绕检测对象绘制方框的方式。标准方法通常强迫这些方框呈现出僵硬的形状,这对于不规则物体来说可能并不准确。新系统使用了一种更灵活的方法,尊重物体的实际形状,无论它是长而细还是短而宽,从而确保位置标记得精确无误。

为了测试这些改进是否奏效,研究人员利用他们创建的新数据集对系统进行了训练,该数据集包含超过 17,000 张城市场景图像。他们将该系统与其他流行的检测方法进行了对比测试,发现他们的新方法在寻找正确目标方面表现显著更好,且漏检率更低。在测试中,该系统在应该发现异常的情况下,正确识别了 83.1% 的案例,这比标准模型有了显著提升。它还成功找出了图像中实际存在的所有问题的 77.1%,这是对于漏掉隐患会导致危险的安全应用场景而言的关键指标。或许对实际应用而言最重要的一点是,该系统保持了极高的速度。它处理一张图像并给出答案仅需 2.31 毫秒,这意味着它理论上每秒可以分析数百张图像。这种速度表明,该技术可以安装在移动车辆或无人机上,实现对城市街道的持续监控而无延迟。

研究还探讨了不同设置如何影响系统的性能,证实了他们所选择的技术组合是最有效的。他们发现,使用中等规模的“远程视野”至关重要;观察得太窄会丢失上下文信息,而观察得太广则会引入过多的干扰。同样,他们发现,针对城市损坏的不规则特性,使用最具灵活性的形状检测设置效果最好。虽然该系统并不完美,仍可能被极端光照或严重遮挡所迷惑,但结果展示了一条清晰的前行路径。研究人员承认,仍需要在不同的天气条件和地点进行更多测试,但目前的发现表明,计算机现在已经可以被训练来观察城市生活中那些微妙、破碎且混乱的细节,并达到以往无法企及的准确度和速度。这项工作为城市提供了从被动维修转向主动安全的有力工具,确保我们赖以生存的基础设施正受到持续、不眨眼的注视。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →