Deep neural networks with Fisher vector encoding for medical image classification
本文提出将费雪向量编码与混合 CNN-ViT 架构相结合,以增强不同数据集规模下的医学图像分类能力,通过可扩展的高斯混合模型估计方法解决计算限制,并在多个基准测试中实现了最先进或具有竞争力的结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人识别不同类型的医学图像,比如 X 光片或皮肤扫描图。这个机器人需要学会分辨“健康”的肺和“患病”的肺有何不同,或者如何识别出可能危险的痣。
本文提出了一种训练该机器人的新方法,该方法专为无论面对少量照片还是海量图库都能良好工作而设计。以下是他们如何做到这一点的故事,其中使用了一些简单的类比。
问题:两种不同的工具,一团乱麻
研究人员从人工智能领域中两种流行的强大工具入手:
- CNN(卷积神经网络):可以将其想象为一个拥有极其敏锐、局部化双眼的机器人。它非常擅长捕捉小细节(比如细胞中的特定纹理),但有时会因为过于关注紧邻的局部而错过“大局”。
- ViT(视觉 Transformer):可以将其想象为一个拥有超广角视野的机器人。它能够看到图像不同部分之间的全局关联。然而,它有点“贪吃”——需要海量的“食物”(数据)来学习,如果图像很大(比如高分辨率的医学扫描图),它会变得非常困惑。
研究人员希望将这两者结合成一个混合机器人,使其同时拥有敏锐的局部双眼和广阔的视野。但这里有个陷阱:当你将它们混合时,仍然需要一种方法,将机器人看到的所有信息汇总成一张单一的“成绩单”,以便它能做出最终决策。
解决方案:“费雪向量”成绩单
通常,AI 模型使用一种简单的方法来汇总图像,比如取所有内容的平均值(全局平均池化)。作者决定使用一种更复杂的方法,称为费雪向量(Fisher Vectors)。
类比:音乐节 vs. 播放列表
- 标准方法(平均池化):想象你在参加一场音乐节。标准方法会问:“平均音量是多少?”它只给你一个数字。这很快,但失去了所有细微差别。人群欢呼了吗?有独奏吗?你不知道。
- 费雪向量方法:这种方法就像创建一份详细的播放列表和人群情绪报告。它不只是求平均值,而是查看播放的每一首歌和听到的每一次欢呼。它将它们与“标准”音乐节声音模型进行比较。它会记录:“这首歌比平时更响亮”,或者“这种欢呼比正常情况更频繁”。
通过这样做,机器人创建了对图像更丰富、更详细的描述。当没有成千上万的示例可供学习时(这在医学中很常见,因为获取标注数据既困难又昂贵),这尤其有帮助。
障碍:“图书馆”问题
在大型数据集上使用这种详细的“费雪向量”方法存在一个大问题。为了创建那份详细的报告,AI 必须构建一个它所见过的所有数据的复杂统计地图(称为高斯混合模型或 GMM)。
类比:不堪重负的图书管理员
想象你是一位试图整理图书馆的图书管理员。
- 如果你只有100 本书,你可以阅读每一本并创建完美的目录。
- 如果你有1000 万本书,试图阅读每一本来制作目录需要花费永恒的时间,并且会弄坏你的大脑(计算成本)。
过去,人们试图通过扔掉大部分书、只读几本来解决这个问题。但作者担心这可能会导致目录不准确。
创新:“智能采样”
作者想出了一个巧妙的技巧,在不丢失重要信息的情况下解决了“不堪重负的图书管理员”问题。
- 熵过滤器:他们没有随机挑选书籍,而是查看了每张图片的“混乱”程度或“信息密度”(称为熵)。他们挑选了最有趣、最复杂的图片来构建目录,而忽略了无聊、平淡的图片。
- 结果:他们发现,通过使用数据中一小部分经过智能选择的切片(例如总量的 2%),他们可以构建出一个几乎与从整个图书馆构建的目录完全相同的目录。这节省了巨大的计算能力。
“无损”拼接
另一个问题随之而来,因为混合机器人会在不同的“缩放级别”(阶段)观察图像。有些视图是高分辨率的(包含大量微小细节),而其他视图是低分辨率的(包含大致形状)。
- 旧方法:为了比较它们,人们会将高分辨率细节缩小以适应低分辨率视图,这实际上丢弃了精细细节。
- 新方法:作者发明了一种无损拼接方法。想象你有一个大拼图和一个小拼图。他们不是挤压大拼图,而是将大拼图的碎片分解成更小的、兼容的碎片,这些碎片完美地契合小拼图,而不丢失任何画面。这使得他们能够将机器人的所有不同“视图”组合成一份超级强大的报告。
结果:赢得医学竞赛
团队在他们的几种医学图像数据集上测试了这种带有“智能成绩单”的新“混合机器人”:
- MedMNIST:一组小型、标准化的医学图像(如 28x28 像素的 X 光和 CT 扫描)。
- 现实世界测试:更大、更真实的皮肤病变图像(ISIC2018)和 COVID-19 肺部扫描(Clean-CC-CCII)。
结果:
- 在小型数据集上,他们的模型打破了所有之前的记录(基准测试)。这证明了当数据稀缺时,“费雪向量”方法是一种超能力。
- 在更大的现实世界数据集上,尽管使用的计算资源较少,但其表现与文献中最先进的模型相当甚至更好。
总结
简而言之,作者构建了一个医学图像分类器,它:
- 结合了两个 AI 世界的最佳之处(CNN 和 Transformer)。
- 使用复杂的“详细成绩单”(费雪向量)来深入理解图像。
- 通过智能采样仅最有趣的图像来构建统计地图,从而解决了“数据过多”的问题。
- 证明了你不需要巨大的超级计算机来获得顶级的医学 AI 结果;你只需要一种更聪明的方法来组织你拥有的数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。