Synthetic Data Generation for Long-Tail Medical Image Classification: A Case Study in Skin Lesions
本文提出了一种由扩散模型驱动的合成数据增强流程,该流程包含一种新颖的图像修复模型和一种分布外后选择机制,以有效解决医学图像分类中的长尾类别不平衡问题,并在 ISIC2019 皮肤病变数据集上实现了显著的性能提升,尤其是在罕见类别上。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一名学生识别不同类型的皮肤斑点。在现实世界中,有些斑点非常常见(例如“头部”类别),而另一些则极其罕见但危险(例如“尾部”类别)。
问题在于,你的学生只能学习 10,000 张常见斑点的图片,却只有 50 张罕见且危险斑点的图片。自然而然地,这名学生在识别常见斑点方面成为了专家,但一旦遇到罕见斑点,就会彻底失败。这就是医疗人工智能中的“长尾”问题。
本文提出了一种巧妙的解决方案:不要仅仅更努力地学习;而是创造更多的学习材料。
以下是他们如何做到的,通过简单的类比进行解释:
1. 问题:不平衡的图书馆
将医疗数据集想象成一座图书馆。“头部”类别拥有摆满书籍(图片)的整排书架,而“尾部”类别在底层书架上只有一本积满灰尘的书。当人工智能尝试学习时,它会忽略底层书架,因为那里没有什么可阅读的。但在医学领域,那本孤零零的书可能描述了一种致命疾病,因此忽略它是危险的。
2. 解决方案:“魔法复印机”(扩散模型)
作者没有等待更多真实患者出现,而是建造了一台“魔法复印机”(扩散模型),能够生成那些罕见皮肤斑点的新颖、逼真的图片。
- 图像修复(Inpainting)技巧:想象你有一张皮肤斑点的照片,但你擦除了斑点本身,只留下周围的皮肤。人工智能的任务就是在这个空白区域“绘制”一个新的斑点。
- 转折:他们训练这台人工智能观察周围的皮肤以及他们想要创建的特定疾病类型,然后在空白空间中“绘制”出该罕见疾病的全新、逼真版本。
3. 安全检查:“质量控制检查员”(分布外过滤)
这里有个陷阱:当你要求人工智能想象它很少见过的东西时,它有时会感到困惑并画出荒谬的内容(例如蓝色的皮肤斑点,或者看起来像卡通的斑点)。这些被称为分布外(OOD)样本——不属于现实世界的虚假数据。
如果你将这些虚假、怪异的图片喂给你的学生,他们可能会感到困惑并学到错误的东西。
因此,作者添加了一名质量控制检查员。在将新图片加入学生的学习堆之前,这名检查员会进行检查。如果一张图片看起来太怪异,或者不符合该疾病“现实世界”的规则,检查员就会将其丢弃。只有干净、逼真且“分布内”的图片才能留下。
4. 结果:更优秀的学生
作者在著名的皮肤病变数据集(ISIC2019)上测试了这种方法。
- 设置:他们选取了罕见疾病(样本极少的疾病),利用他们的“魔法复印机”生成了数百张高质量合成图像,过滤掉劣质图像,并将它们与原始照片混合。
- 结果:他们在这一新的、平衡的数据堆上训练了一个标准的人工智能分类器。
- 总体得分:人工智能在识别所有类型斑点方面有了显著提升。
- 重大胜利:罕见疾病的表现得到了巨大改善。对于最罕见的类别(皮肤纤维瘤),准确率提升了超过 28%。
- 对比:他们的方法击败了其他试图通过改变数学方法(损失函数)或构建复杂的团队式人工智能模型来解决该问题的顶级方法。他们仅仅是通过为人工智能提供更好、更平衡的学习材料就做到了这一点。
5. “甜蜜点”的发现
他们还发现了质量控制的一个“金发姑娘”(Goldilocks)区域。
- 如果他们保留太多生成的图像(包括那些怪异的图像),人工智能就会感到困惑。
- 如果他们保留太少,就无法为罕见疾病提供足够的帮助。
- 他们发现,在过滤后保留约**20% 到 60%**的生成图像,是在不增加噪声的情况下提升性能的最佳平衡点。
总结
简而言之,这篇论文指出:“不要试图用一本微小且不平衡的教科书来教导学生。使用一台经过智能安全检查的复印机,为那些稀有的章节打印更多页面,你的学生就会学得更好。”
这种方法不需要为人工智能构建一个超级复杂的新大脑;它只是为现有的大脑提供了一套更公平的学习材料。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。