← 最新论文
⚡ electrical engineering

BreastMammo and DenseMammo: Benchmarks for Mammography Domain Generalization

本文介绍了 BreastMammo 和 DenseMammo 数据集,并提出了一种仅针对前景的直方图匹配框架,该框架通过有效解决跨多个临床站点的特定厂商领域偏移,在乳腺密度分类任务中显著优于现有的领域泛化方法。

原作者: Hongyi Pan, Gorkem Durak, Halil Ertugrul Aktas, Andrea Mia Bejar, Mustafa Ege Seker, Nebile Alibeyoglu, Rumeysa Guclu, Rana Gunoz Comert Bozkurt, Sibel Ozkan Gurdal, Neslihan Cabioglu, Beyza Ozcinar
发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongyi Pan, Gorkem Durak, Halil Ertugrul Aktas, Andrea Mia Bejar, Mustafa Ege Seker, Nebile Alibeyoglu, Rumeysa Guclu, Rana Gunoz Comert Bozkurt, Sibel Ozkan Gurdal, Neslihan Cabioglu, Beyza Ozcinar, Ravza Yilmaz, Vahit Ozmen, Erkin Aribal, Sukru Mehmet Erturk, Yalda Zafari, Mohamed Mabrok, Kayhan Batmanghelich, Mohammad Yaqub, Ziyue Xu, Ulas Bagci

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个医生拥有一副超级力量眼镜的世界,这副眼镜可以看穿人体,在危机发生前发现问题。这就是人工智能(AI)在医学领域的承诺,特别是在观察乳房摄影(一种特殊的乳腺 X 线影像)方面。多年来,科学家们一直在训练这些 AI “眼镜”来识别乳腺癌,但他们遇到了一个令人沮丧的障碍。你看,每家医院使用的 X 线机都不一样,来自不同的公司,就像每种品牌的相机拍摄的照片颜色和光影略有不同一样。在一个品牌照片上训练出的 AI,在看到另一个品牌的照片时往往会感到困惑。这就像教学生只通过一种特定的艺术风格来识别猫,当给他们看另一种风格的照片时,他们可能无法意识到那是同一只猫。这种困惑被称为“领域偏移”(domain shift),这是一个巨大的问题,因为这意味着在一个医院表现完美的 AI,到了下一家医院可能会失效,从而导致漏诊。

这篇论文介绍了一种巧妙的新方法来解决这种困惑。研究人员创建了两个全新的乳房摄影数据集,分别命名为 BreastMammoDenseMammo,它们充当了一个巨大的、多样化的 AI 练习测试。但真正的魔力不仅在于数据,还在于他们发明的一种新技术,旨在教 AI 如何忽略“相机风格”而只关注“猫”。他们称之为仅前景直方图匹配(foreground-only histogram matching)。你可以把它想象成一个照片编辑器,它准确地知道图像中哪些部分是实际的乳腺组织,哪些部分只是空旷的黑色空间。与其尝试修复整个图像(包括无用的黑色背景),不如只调整组织本身的亮度和对比度,使其符合标准外观。通过这样做,无论哪种机器拍摄,AI 都能学会识别组织的形状和纹理。结果令人鼓舞:当他们在从未见过的医院数据上进行测试时,该 AI 在识别致密组织以及区分良性和恶性病例方面表现得更好,超越了其他试图解决该问题的流行方法。

问题所在:“相机滤镜”问题

想象一下,你正在试图教一个机器人识别苹果。你给它看成千上万张在阳光明媚的厨房里拍摄的红苹果照片。机器人学得非常完美。但随后,你把它带到了另一个光线昏暗且发黄的厨房,那里的苹果看起来是橙色的。机器人惊慌失措:“这是苹果吗?”它问道,“这看起来不像我认识的那些苹果!”

在乳房摄影的世界里,情况正是如此。医院使用不同的 X 线机(来自 GE、Hologic 或 Siemens 等供应商),每台机器处理图像的方式略有不同。有的机器会让组织看起来非常明亮且高对比度,而有的则会让它看起来更柔和、更灰暗。如果一个 AI 模型仅在一家或两家医院的数据上进行训练,它就会把这些机器的“风格”与实际的疾病联系起来。如果你将该模型发送到一台拥有不同机器的第三家医院,它就会感到困惑。论文称之为领域偏移。这是一个主要障碍,因为这意味着我们不能仅仅构建一个“完美”的 AI 并到处使用它;我们需要一种方法让 AI 对这些相机差异免疫。

新数据:一个庞大的练习库

为了解决这个问题,研究人员首先需要更好的练习材料。他们引入了两个新的数据集:

  1. BreastMammo:这是由 447 名患者894 幅图像 组成的集合。这些是“诊断性”图像,意味着它们是在患者已经出现症状或肿块时拍摄的。每位患者都有一个乳房的两个视图(俯视图和侧视图)。图像标记了肿块是良性(无害)还是恶性(癌症),并且包含了患者的乳腺密度类别。
  2. DenseMammo:这是一个更大的“筛查”数据集,包含来自 620 名患者2,480 幅图像。这些是针对没有症状的人进行的常规检查。这里的每位患者都有一套完整的四个视图(双侧乳房,每个角度两个视图)。

这两个数据集都经过精心策划,带有专家标注的乳腺密度(类别 A 到 D),并可供其他科学家使用。目标是创建一个标准化的“测试赛道”,让所有人都能在相同的规则下竞赛他们的 AI 模型。

解决方案:“仅组织”过滤器

研究人员意识到,以往修复“相机风格”问题的尝试都犯了错误。有些方法试图将不同图像的“特征”混合在一起,这就像混合颜料来创造一种新的色调。问题在于,这可能会不小心模糊掉组织纹理中微小且重要的细节。其他方法试图更换图像的“频率”(就像调节歌曲的低音和高音一样),但这往往会弄乱背景,在 X 线的黑色空隙部分添加奇怪的噪声。

该团队提出了一个新方法:仅前景直方图匹配

它是如何工作的,我们可以用一个简单的类比:
想象你有一张印在纸上的黑白森林照片(乳腺组织)。这张纸周围有一个巨大的黑边(X 线的空隙空间)。

  • 旧方法 试图调整整张纸的亮度,包括黑边。这是错误的,因为黑边只是空隙;改变黑边并不能帮你更好地看清树木,甚至可能让树木看起来很奇怪。
  • 新方法 在黑边上放了一个遮罩。它说:“忽略这部分。我们只关心树木。”然后,它只查看“仅树木部分”的“直方图”(显示暗像素、亮像素及中间像素数量的图表)。然后,它调整源照片中树木的亮度,使其与参考照片中树木的亮度相匹配。

至关重要的是,他们不仅仅是交换风格;他们还创建了一个平滑的梯度。他们生成新的“合成”图像,这些图像是原始图像与新风格的混合体。他们为每张图像创建四个版本,以 25%、50%、75% 和 100% 的比例进行风格融合。这教会了 AI,同样的组织根据机器的不同可能会看起来略有不同,但它仍然是同一种组织。

结果:有效吗?

研究人员使用一种强大的 AI 模型——Swin Transformer 测试了他们的系统。他们运行了两类测试:

1. 内部测试(练习赛)
他们在自己的新数据集(BreastMammo 和 DenseMammo)上训练 AI,并使用五折交叉验证(一种确保模型不是仅仅靠死记硬背来确保严谨性的方法)在相同数据上检查其表现。

  • 结果: Swin Transformer 模型在 DenseMammo 数据集的密度分类任务中达到了 98.32% 的峰值 AUC。这是一个非常高的分数,表明当 AI 熟悉数据时,它在执行该任务方面极其出色。
  • 他们还发现,使用高分辨率图像(512x512 像素)与标准尺寸(224x224)相比并没有带来太大帮助,这可能是因为 AI 本身就是基于标准尺寸进行训练的。

2. 外部测试(现实世界挑战)
这是最重要的部分。他们将使用其数据训练的 AI 用于测试来自其他医院的两个完全不同的数据集:TNMammoLUMINA。这些数据集使用了不同的机器和不同的风格,代表了“领域偏移”问题。

  • 没有使用该方法时: AI 表现挣扎。在 TNMammo 上,AUC 为 83.46%。在 LUMINA 上,AUC 为 81.72%
  • 使用该方法后: AI 显著提升。在 TNMammo 上,AUC 跳升至 86.38%。在 LUMINA 上,上升至 86.13%
  • 对比: 他们将自己的方法与其他流行技术(如混合特征的 MixStyle 和交换频率模式的 DFT)进行了比较。他们的“仅前景”方法始终优于这些方法。

为什么这很重要

论文指出,通过严格专注于组织并忽略空白背景,AI 学习到了一种能够跨越不同机器观察乳房的“通用”方式。作者认为,试图修复整个图像(包括背景)会引入噪声和混乱,而他们的针对性方法则保留了诊断所需的细腻纹理。

归根结底,这不仅仅是为了在测试中获得更高的分数。这是为了构建可以在世界任何地方、任何医院都能被信任的 AI。如果 AI 可以学会忽略“相机滤镜”而专注于“猫”,它就能帮助世界各地的医生更早、更准确地检测出乳腺癌,无论他们使用的是什么样的设备。研究人员已将其数据和代码向公众开放,希望这种“仅组织”的小技巧能成为构建更好、更可靠医疗 AI 的标准工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →