← 最新论文
💻 computer science

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

该论文提出了 ADOPD,一种具有参考特权的在策略蒸馏框架,通过利用能够感知参考信息的教师模型来引导细粒度的异常检测,将基于参考对比的优势内化到仅需查询的学生模型中,从而在 MMAD 基准测试上实现了最先进的零样本性能。

原作者: Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你的犯罪现场不是案发现场,而是工厂车间。你的任务是发现一个崭新小玩意儿上不该有的极其微小的划痕。这就是**工业异常检测(Industrial Anomaly Detection)**的世界。长期以来,计算机在这方面表现得很糟糕,因为它们只知道广义上的“正常”是什么样子的,而不知道每一件流水线上产品特有的细微特征。

于是,**多模态大语言模型(MLLMs)**登场了。把它们想象成超级聪明的 AI 侦探,它们能同时看图并阅读文本。它们擅长推理,但往往会错过捕捉缺陷所需的那些微小、具体的细节。通常,为了帮助这些 AI 侦探,人类会给它们一张“参考照片”——即一张完美、无缺陷物品的照片,用来与可疑物品进行对比。这就像是给侦探展示一张完美的指纹照片,以便他们能发现真实指纹上的污迹。然而,为每一件物品都准备一张这样的照片既缓慢又耗费计算资源,就像要求侦探每看到一个线索都要跑去图书馆查阅参考书一样。研究人员提出的核心问题是:我们能否教会 AI 记住那张完美的参考图长什么样,这样它就不需要每次都去查阅了?

这就是一项新研究的切入点,该研究提出了一种名为 ADOPD 的巧妙训练方法。研究人员希望看到能否将对比图像的优势在训练阶段就“内化”到 AI 的大脑中。他们不仅仅想让 AI 记住答案,更想让它学会如何进行检查

团队设置了一个包含两个角色的训练场景:老师(Teacher)学生(Student)。老师是一个超级聪明的 AI,它既能看到可疑物品,也能看到完美的参考照片。学生是我们将来真正要使用的 AI,它只能看到可疑物品。目标是让学生在没有参考照片的情况下,表现得像老师一样聪明。

但问题的关键在于,老师可能太聪明了。它可能会仅仅因为阅读文本或观察图片的整体氛围就猜对答案,而忽略了它本应进行的具体对比。为了解决这个问题,研究人员为老师发明了一个“找不同”的游戏。他们向老师展示了同一个学生的猜测两次:一次是配合正确的参考照片(“匹配”视图),另一次是配合错误的参考照片(“不匹配”视图)。

如果老师真的在意参考图,那么当它看到正确的照片时,其置信度应该飙升;而看到错误的照片时,置信度则会下降。研究人员利用这种差异创建了一个特殊的“置信度分数”。如果老师是因为错误的参考图而产生信心,那么学生就会学会忽略那个线索;如果老师是因为正确的参考图而产生信心,那么学生就会学会密切关注。这个过程被称为参考特权在策略蒸馏(Reference-Privileged On-Policy Distillation)。这就像教练观察球员练习,但只有当球员确实在使用正确的技巧时,教练才会给出反馈,而不是仅仅靠猜测。

结果表明,这种方法效果惊人。在包括七种不同工业检测任务的 MMAD 基准测试中,这种新方法实现了 77.31% 的平均准确率。这是一个巨大的飞跃,比基础模型提高了 6.14 个百分点。更令人印象深刻的是,这个在测试期间从未见过参考照片的 AI,其表现甚至优于允许查看参考照片时的模型(“单样本/one-shot”设置),在**准确率(accuracy)上领先了 2.64 个百分点。然而,研究指出存在一种权衡:虽然新方法找到了更多的缺陷(更高的召回率),但它也更容易产生误报,导致与单样本设置相比在精确率(precision)**上略有下降。

这项研究表明,通过使用这种“匹配 vs 不匹配”的训练技巧,AI 学会了一种细粒度的策略来识别缺陷。它不仅仅是在记忆事实,而是学会了寻找那些真正重要的视觉差异。研究人员发现,这种方法在确定缺陷位置以及缺陷类型方面特别有效,而不仅仅是猜测类别。虽然该方法目前在训练时需要成对的图像和特定的标注,但研究结果表明,我们可以教会 AI 成为一名更敏锐、更自立的检查员,能够在不需要每次都依赖参考图的情况下,精准地发现最细微的瑕疵。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →