← 最新论文
💻 computer science

MAGE: Color-Invariant and Spatial Knowledge Distillation for Gastric Neoplasm Classification

该论文提出了 MAGE,这是一个利用来自辅助掩码无色专家分支的颜色不变性与空间知识蒸馏,以克服纹理偏差和上下文限制的新型框架,从而在无需推理时需要标注掩码的情况下,实现卓越且具有可解释性的胃类瘤分类。

原作者: Jiho Jun, Jeongwon Woo, Jaemin Song, Thanh Bong Nguyen, Dong-heon Yeon, Donghoon Kang, Jae-Myung Park, Sung-Jea Ko, Kwang-Hyun Uhm

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiho Jun, Jeongwon Woo, Jaemin Song, Thanh Bong Nguyen, Dong-heon Yeon, Donghoon Kang, Jae-Myung Park, Sung-Jea Ko, Kwang-Hyun Uhm

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在胃部破解谜团的侦探。你的两个嫌疑人是胃腺瘤(一种无害的、癌前病变的肿块)和胃癌(一种危险的癌症)。它们看起来极其相似——就像穿着同样衣服的孪生兄弟。即使是资深的医生有时也难以分辨它们,在使用标准白光摄像头时,准确率仅为74%左右;即使使用先进的增强成像技术,在棘手案例中的准确率也会降至5约56%。

目前试图解决这一问题的计算机程序(AI)存在一个问题:它们很容易被误导。它们往往会关注“背景噪声”——比如奇怪的光影折射、一滴血迹或周围组织的颜色——而不是专注于肿块本身的形状和纹理。这就像是一个学生因为记住了答案纸的颜色,而不是学会了数学知识,从而在数学考试中不及格。

论文的核心思想:MAGE
为了解决这个问题,作者创建了一个名为 MAGE(掩码无色引导专家,Masked Achromatic Guidance Expert)的新型 AI 框架。可以将 MAGE 想象成一个协同训练的两人侦探小组:

  1. “盲人”专家(老师): 这位侦探是在一个特殊版本的图像上进行训练的,该图像去除了所有色彩(变为灰度图),并且将肿块之外的所有内容都涂成了黑色。这位侦探被迫忽略那些干扰性的颜色和光影把戏。他们只能从纯粹的形状和结构中学习。因为他们在训练期间拥有一个“掩码”(肿块的完美轮廓),他们成为了识别这两名嫌疑人结构差异的大师。
  2. “明眼”侦探(学生): 这是将在现实世界中实际工作的侦探。他们看到的是完整的、彩色的、混乱的图像。他们没有掩码来引导。

他们如何共同学习
“盲人”专家通过**蒸馏(distillation)*过程来教导“明眼”侦探。专家说:“嘿,看形状!忽略红色的血和亮光。关注纹理!”明眼侦探试图模仿这种专注力。他们学习去关注图像中正确的部分*(即肿块本身),并忽略背景干扰,尽管他们仍然能看到颜色。

他们的发现
论文表明这种团队协作非常有效。

  • 更高的评分: 在一个来自韩国医院、包含超过 2,400 张图像的数据集上,MAGE 系统实现了 0.786 的 AUC0.733 的 F1 分数。这高于其他顶尖方法,如 YOLO(一种检测模型)和 Swin-Transformer(一种分类模型),后者的得分分别为 0.7440.718
  • 更好的专注力: 当团队检查 AI 观察的位置时,发现 MAGE 的表现要好得多。虽然标准 AI 可能只有约 31% 的时间在关注肿块(掩码内注意力),但 MAGE 关注肿块的时间达到了 53%
  • 颜色测试: 作者测试了改变图像颜色(模拟不同的灯光或相机设置)会发生什么。标准 AI 模型会感到困惑且得分下降。然而,MAGE 保持了强大且可靠的表现,证明它确实学会了忽略颜色陷阱。
  • 跨领域测试: 他们甚至在另一个涉及结肠图像的名为 PICCOLO 的数据集上进行了测试。MAGE 依然表现出色,实现了 0.9434 的 AUC,超越了 ResNet50 基准模型(得分为 0.9110)和其他模型。这表明该方法擅长学习适用于不同场景的通用“形状规则”。

他们明确排除了什么
论文论证了反对依赖颜色作为主要线索。他们发现颜色可能是一个“混淆变量”——一个误导性的提示,会让 AI 变得懒惰。他们还表明,在实际诊断过程中仅仅通过裁剪掉肿块(使用掩码)是不切实际的,因为那时你还没有掩码。这就是为什么他们需要“盲人”专家在训练期间教导“明眼”侦探,以便最终的模型可以在无需掩码的情况下处理完整图像。

他们有多确定?
作者基于其实验结果对这些发现相当自信。他们进行了 20 次 测试以获得平均值,显示出结果非常稳定(误差范围很小,如 ± 0.010)。他们还使用一个完全独立的外部数据集(PICCOLO)进行了测试,以证明这并非偶然。然而,他们承认虽然该系统在分类(判断“这是癌症”还是“这不是癌症”)方面表现出色,但它目前还无法在实际手术期间为医生画出完美的肿块轮廓。他们建议,下一步可以利用这个智能分类器来辅助绘制这些轮廓,但这尚未实现。

简而言之,MAGE 通过训练一位“盲人”导师来教导 AI 如何忽略华丽的干扰,转而关注真实的形状,从而使 AI 成为一名更优秀的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →