A multifractal-based masked auto-encoder: an application to medical images
本文提出多分形优化掩码自编码器(MO-MAE),这是一种新颖的框架,它利用 Rényi 熵引导掩码策略聚焦于具有诊断关键性的高复杂度区域,从而在相较于现有模型最小化计算开销的同时实现更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在通过展示图片来教学生识别不同种类的水果。
旧方法(传统人工智能):
通常,当我们训练人工智能理解医学影像(如 X 光片或皮肤扫描)时,会使用一种称为“掩码自编码器”的方法。这就像玩一个游戏:你用黑色方块遮盖水果图片的随机部分,然后让学生猜测下面是什么。
- 问题所在: 如果你在香蕉上随机遮盖一个部位,可能会遮住一个微小但至关重要的褐色斑点,而这个斑点恰恰能告诉你香蕉已经过熟。但如果你遮盖的是纯白色背景上的随机部位,则无关紧要。传统人工智能将图像的每个部分同等对待,因此它可能会浪费时间去学习空白区域,却错过了那些真正能诊断疾病的微小细节。
新方法(本文的解决方案):
本文作者 Joao Batista Florindo 和 Viviane de Moura 提出了一种更聪明的游戏方式。他们将新系统称为MO-MAE。
他们不再遮盖随机部位,而是使用一种名为多重分形分析(具体为Rényi 熵)的特殊数学工具,将其作为“复杂度检测器”。
类比:“繁忙”与“安静”的街区
想象医学影像是一张城市地图。
- 有些区域是拥有空旷田野的安静郊区(这些是 X 光片中不重要的部分,如肺部周围的空白区域)。
- 其他区域则是拥有拥挤街道、高楼大厦和复杂交通模式的繁华市中心(这些是疾病藏身的复杂组织结构)。
旧的人工智能会随机遮盖地图上的街区,有时遮盖安静的郊区,有时遮盖市中心。
而MO-MAE系统会先查看地图,然后说:“嘿,这个市中心非常复杂且信息丰富!让我们遮盖那里,强迫学生去弄清楚它。”
工作原理(分步说明):
- 切分拼图: 人工智能将医学影像切割成许多小方块(图块)。
- 复杂度检查: 它利用“复杂度检测器”来测量每个图块中包含多少“信息”或“纹理”。高复杂度意味着该图块可能很重要(如肿瘤或特定的组织模式)。
- 智能掩码: 它故意隐藏最复杂的图块。
- 重建过程: 人工智能必须观察剩余的可见图块,并尝试“重绘”被隐藏的复杂部分。由于它被迫优先解决最难的谜题,因此它能更好地学习理解图像中最关键的细节。
- 结果: 当人工智能最终在真实患者身上进行测试时,它在发现疾病方面表现更佳,因为它将训练时间集中在图像的“繁华市中心”,而非空旷的田野上。
研究发现:
研究人员在两项主要内容上测试了这种新方法:
- MedMNIST: 一个包含 708,000 张不同医学影像(如皮肤扫描、眼部扫描和血细胞)的大型集合。
- COVID-CT: 一套用于检测 COVID-19 的 CT 扫描图像。
结论:
新的“智能掩码”系统(MO-MAE)的表现优于许多其他顶级人工智能模型。它特别擅长处理细节微妙的困难图像。
- 它无需成为庞大缓慢的计算机程序即可运行;它非常高效。
- 它在准确率上击败了其他几个著名的人工智能模型(如 ResNet 和 MedVIT)。
- 即使在缺乏大量标注数据进行训练的情况下(这是医学领域的常见问题),它也能有效工作。
简而言之:
本文提出了一种方法,通过在训练期间隐藏医学图像中那些特定且最复杂的部分,使人工智能能够“关注”这些最重要、最复杂的区域。通过迫使人工智能重建最困难的区域,它学会了成为更敏锐、更准确的诊断专家,而无需额外的复杂硬件或海量数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。