OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
OmniAD 是一个新颖的多模态框架,它通过利用基于文本的掩码编码和视觉引导推理,将工业场景中的异常检测与理解统一起来,并通过监督微调与强化学习的混合训练策略,在 MMAD 基准测试上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜团的侦探,但你的调查现场不是犯罪现场,而是一个工厂车间。你的任务是找到那个不属于那里的微小、奇怪的东西——比如金属零件上的一道划痕、腰果上一个奇怪的污渍,或者电路板上缺失的一个螺丝。在计算机世界中,这被称为“异常检测”。长期以来,实现这一目标的最聪明方法是雇佣两位不同的专家:一位充当放大镜,负责标出异常点;另一位充当侦探,负责阅读线索并解释出了什么问题。但问题在于:有时放大镜指向了错误的方向,或者它过于痴迷于那个点,以至于忘记了观察整体情况。这篇论文介绍了一种新型侦探,它不需要单独的放大镜。相反,它学会了同时识别异常点并理解其含义,将其转化为一个流畅的思考过程。这之所以重要,是因为在工厂中,知道异常在哪里以及为什么它是问题,与仅仅知道异常的存在同样重要。
该论文提出了一种名为 OmniAD 的新系统,它是一个“多模态大语言模型”(一种能够看图并阅读文本的高级人工智能),旨在同时实现定位和解释功能。研究人员发现,旧的工作方式——即让 AI 依赖来自独立检测器的“提示”来确定观察位置——实际上是有缺陷的。他们称之为“专家辅助”(Expert-Aid)范式。这就像是要求一名侦探去破案,而旁边却一直有人在喊:“看这里!看那里!”问题在于,那个喊叫的人可能会出错,或者由于声音太大,导致侦探停止了独立思考,只是盲目跟随指引。这会导致错误,尤其是在缺陷非常细微或背景非常复杂的情况下。
为了解决这个问题,OmniAD 使用了一个巧妙的技巧,称为语义异常编码(Semantic Anomaly Encoding)。它不再依赖外部工具在缺陷周围画框,而是学习使用自己的内部“语言”来描述异常点。想象一下,AI 在看一张腰果的照片,并在脑中思考:“好吧,这个坚果的右上部分有一种锯齿状的褐色纹理,与其余部分的平滑奶油色不符。”它将这种视觉上的怪异转化为其大脑内部的一段文本描述。这段文本随后充当了其推理过程的指南。AI 不仅仅会说“这里有缺陷”;它会说“我在这里看到了锯齿状的纹理,这破坏了原本平滑的线条,所以这个坚果可能是破损的。”这个过程被称为视觉引导文本推理(Visual Guided Textual Reasoning)。这就像 AI 在进行自我对话,利用它刚刚发现的视觉线索来帮助它写出更好的解释。
作者在包括 MMAD 在内的多个工业数据集上测试了这个想法。他们发现,OmniAD 在发现缺陷和解释缺陷方面都比其他 AI 模型表现得更好,甚至超过了一些非常著名的模型,如 GPT-4o。事实上,在 MMAD 测试中,OmniAD 达到了 79.9% 的平均准确率,以显著优势超越了之前的最佳开源模型。论文指出,通过将“定位”和“解释”保留在同一个大脑内,AI 会变得更加可靠。它不会被嘈杂的提示所迷惑,也不会忘记观察全局。
研究人员还发现,分两步训练 AI 是关键。首先,他们教授了它关于如何描述缺陷的基础知识(监督微调)。然后,他们让它练习解决问题,并且只有当它得到正确答案和正确解释时才会给予奖励(使用一种称为群体相对策略优化,或 GRPO 的方法)。这种结合帮助 AI 学会了既精准又逻辑严密。论文表明,这种“内在式”方法——即 AI 生成自己的证据并立即使用它——在处理工业问题时,比旧的在不同工具之间传递线索的方法要强大得多。虽然论文并未声称这解决了世界上所有可能的问题,但结果有力地表明,这种统一的思维方式是让 AI 在工厂中变得更聪明、更有帮助的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。