← 最新论文
💻 computer science

YOLO-LOLG Mamba: Cross-Scale Feature Fusion with State Space Models for Industrial Steel Defect Detection

本文提出了一种名为 YOLO-LOLG Mamba 的新型钢材表面缺陷检测框架,该框架通过集成 LODConv、LDAM 和 MsGroupMamba 模块来增强跨尺度特征融合与全局上下文建模,使其在工业数据集上的准确率和泛化能力均优于 YOLOv8n。

原作者: Wei Niu, Qinghua Zhang, Yunfei Jiang, Zhongbin Wei

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Niu, Qinghua Zhang, Yunfei Jiang, Zhongbin Wei

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

钢铁海洋中寻找隐形缺陷

想象一下,你是一家大型钢铁厂的质量检测员。这些钢铁是现代世界的支柱,被广泛用于制造从我们驾驶的汽车到我们居住的摩天大楼的一切事物。但问题在于:钢铁并非完美无缺。在生产过程中,其表面可能会出现微小的裂纹、划痕和凹坑。如果这些缺陷细微到肉眼无法察觉,它们可能会导致钢铁在后期发生断裂,从而引发危险事故或昂贵的维修费用。

为了捕捉这些隐形的“捣蛋鬼”,工厂使用“电子眼”——由人工智能(AI)驱动的智能摄像头。这些 AI 系统通过学习观察钢铁的照片来识别缺陷。长期以来,这类工作的最佳 AI 工具是基于一个著名的算法家族,叫做 YOLO(意为“仅看一次”)。你可以把 YOLO 想象成一名超级快速、观察力敏锐的保安,他在人群中扫描以寻找特定的人。然而,就像人类保安可能会忽略发亮地板上的一粒微尘一样,这些 AI 保安有时难以发现非常小的缺陷或形状奇特的裂纹。它们擅长发现大的目标,但在图像被缩小或处理时,往往会丢失精细的细节。这篇论文正是针对这一特定问题:如何让“电子眼”变得足够敏锐,以便在不减慢工厂速度的情况下,看清那些最微小、最危险的缺陷。

论文的故事:教 AI 看见“不可见之物”

在这项研究中,来自西京学院和中国一家当地能源公司的研究团队决定升级标准的 YOLO AI 保安。他们注意到旧模型漏掉了“小细节”——即那些看起来像细线或模糊边缘的微小划痕和不规则裂纹。问题在于,AI 太关注宏观图景,而在扫描过程中丢失了精细的细节。为了解决这个问题,他们构建了一个更聪明的新版本,名为 YOLO-LOLG Mamba

把旧的 AI 模型想象成一名试图在巨大的广告牌上拍摄一只小蚂蚁的摄影师。摄影师为了看到整个广告牌而不断缩小焦距,但在这样做时,那只蚂蚁就变成了一个模糊的点。研究人员意识到,他们需要两个新工具来帮助这位摄影师:

  1. “超级放大镜”(LODConv): 第一个工具是一个特殊的模块,叫做 LODConv。想象一下,这是一个不仅能放大,还知道该往哪里看的放大镜。它能帮助 AI 抓住微小缺陷中脆弱的细节,使其不会在模糊中丢失。这就像是给保安戴上了一副眼镜,能够突出钢铁的纹理,让即使是最细微的划痕也清晰可见。
  2. “线条追踪器”(LDAM): 钢铁缺陷通常呈现为长而细的线条(如划痕)或奇特的锯齿状形状。标准的 AI 工具并不擅长追踪这些线条,因为它们通常只观察图像中的小型正方形区块。研究人员添加了一个专门设计用于追踪这些长而蜿蜒路径的“线条追踪器”模块(LDAM)。这就像是训练保安去跟随一根横跨杂乱房间的单根纱线,而不是仅仅盯着一堆纱线看。

仅仅看到细节是不够的,AI 还需要理解整体是如何构成的。这就是第三个工具发挥作用的地方:MsGroupMamba

想象你在玩拼图。如果你一次只看一块碎片,你可能意识不到它属于天空的一部分。但如果你能退后一步,看到这些碎片在整个拼图中是如何连接的,你就能更快地解开谜题。MsGroupMamba 模块充当了一个“拼图解谜者”,它将微小的细节(来自放大镜)与宏观图景(整个钢板)联系起来。它使用一种称为“状态空间模型”的特殊数学方法,同时观察整幅图像,理解角落里的一处小划痕与剩余表面之间的关系。这有助于 AI 理解缺陷的“故事”,而不仅仅是它的形状。

研究发现

研究人员在两个著名的钢铁缺陷照片集上测试了他们的新型 YOLO-LOLG Mamba 系统:NEU-DET 数据集(包含 1,800 张图像,涵盖六种缺陷类型)和 GC10-DET 数据集(包含 2,300 张图像,涵盖十种不同类型的缺陷)。

结果令人振奋。在 NEU-DET 数据集上,新模型达到了 80.55% 的得分(具体为 mAP@0.5 为 80.55%)。对比来看,标准的 YOLOv8 模型(“之前”的版本)得分仅为 76.61%。这意味着新系统正确发现了约 3.94% 更多的缺陷。更令人印象深刻的是,新模型实际上比旧模型更小、更快。它使用的计算资源更少(仅 2.36 百万个参数6.1 GFLOPs 的计算能力),而标准的 YOLOv8 则使用了 2.69 百万个参数6.9 GFLOPs

团队还进行了“消融实验”,这是一种高级说法,指的是他们拆解了新模型,以观察每个部分的作用。他们发现:

  • 仅添加“超级放大镜”(LODConv)会有所帮助。
  • 仅添加“线条追踪器”(LDAM)会有所帮助。
  • 仅添加“拼图解谜者”(MsGroupMamba)也会有所帮助。
  • 但当他们将三者结合在一起时,模型的表现最好,既能发现更多缺陷,又保持了轻量化。

他们还将这种新的注意力机制(“线条追踪器”)与其他流行的方法(如 LKAttention 和 MSCA)进行了对比。他们的 LDAM 方法始终能发现更多缺陷并减少错误,证明了它在忽略背景噪声并专注于实际裂纹方面表现得更好。

核心结论

这篇论文并未声称解决了世界上所有的钢铁检测问题。作者谨慎地指出,他们的模型是在公开数据集上测试的,在处理现实世界的复杂情况(如光照变化或不同类型的金属)时可能仍需进一步改进。然而,他们提出,通过结合用于微小细节的“放大镜”、用于奇特形状的“线条追踪器”以及用于宏观图景的“拼图解谜者”,他们创造了一个更敏锐、更高效的 AI 工具。

简单来说,他们教会了计算机保安不再仅仅是“看一眼”,而是开始真正“看见”那些此前隐藏在眼皮底下的微小且危险的缺陷。这表明,在未来,工厂或许能够更早地捕捉到缺陷,从而让我们的钢铁结构更加安全、更加坚固。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →