Challenges and proposed solutions in modeling multimodal medical data: A systematic review
这项针对69项研究的系统综述综合了建模异构多模态医学数据所面临的关键挑战及拟定的方法论解决方案,旨在提高诊断准确性并促进个性化医疗。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个巨大且复杂的拼图,但你拥有的不仅仅是一个拼图盒,而是好几个。其中一个盒子装满了彩色的图片(比如医学影像),另一个有长长的数字列表(比如基因代码),第三个装满了日常日记(比如病历),第四个则是来自智能手表的数据(比如心率)。在医学科学领域,这被称为多模态数据(multimodal data)。“Multi”意味着多,“modal”指的是信息的不同类型或“模式”。医生一直都知道,仅仅观察一种类型的信息——比如只看X光片或只看血液检测报告——就像是通过单一的画面来试图理解一整部电影。为了获得患者健康的完整故事,你需要将所有这些不同的碎片结合起来。
然而,将这些不同的拼图盒混合在一起是非常棘手的。它们的碎片并不自然契合;它们的形状、大小和颜色都不同。有些盒子完全缺失了碎片,有些则有成千上万个微小的碎片,而另一些可能只有寥寥数个,有时碎片太小或者图像太模糊,以至于很难辨别发生了什么。这正是人工智能(AI)领域的科学家们试图解决的问题。他们正在构建计算机程序,让计算机学会如何将这些不同的拼图盒组合在一起,从而帮助医生做出更好的决策。但在构建出完美的机器人解谜者之前,他们必须先弄清楚如何处理现实世界的混乱。
这篇文章是过去十年里尝试解决这个拼图问题的巨大“成绩单”。作者们是一组来自德国大学的研究人员,他们并没有亲自构建一个新的机器人。相反,他们扮演了侦探的角色,追踪并搜寻了 2011 年至 2023 年底发表的 69 项不同研究。他们阅读了每一项研究,以查明当科学家尝试混合医疗数据时遇到了哪些问题,更重要的是,他们使用了哪些技巧来解决这些问题。他们想知道:这个领域最大的头痛问题是什么,我们解决这些问题的能力是否在提高?
五大头痛问题
在整理了数百篇论文后,团队发现几乎所有人都在进行同样的五场战斗。
1. 缺失碎片问题 (The Missing Piece Problem)
想象一下你在尝试解决拼图,但对于某些患者来说,“X光片”那个盒子是完全空的。也许是机器坏了,也许是患者负担不起这项检查,或者他们退出了研究。在现实世界中,这种情况经常发生。研究发现,69 项研究中的 15 项(约 22%)必须处理这个问题。
- 解决方法: 智能计算机程序不再只是瞎猜或留白,而是正在学习如何“幻觉”出缺失的部分。它们使用像生成对抗网络(GANs)这样的技术,这就像两个 AI 画家在玩游戏:一个试图画出一张看起来真实的假 X 光片,而另一个试图识破这个假货。通过这种练习,AI 学会了为缺失的数据创建一个现实的猜测。其他方法使用知识蒸馏(knowledge distillation),即一个了解某种数据所有信息的“教师”AI 教导一个“学生”AI 如何预测剩余部分,即使它还没见过所有的碎片。
2. 微小人群问题 (The Tiny Crowd Problem)
有时,你有一个拼图,但只有少数几个人能帮你解决它。在医学研究中,这被称为小数据集。研究发现这是最常见的挑战,出现在 17 项研究(25%)中。如果你试图仅用五个例子就教会计算机识别一种罕见疾病,它很可能会只是死记硬背那五张图片,而在遇到新情况时就会失败。
- 解决方法: 为了绕过这个问题,研究人员正在使用迁移学习(Transfer Learning)。这就像是找一个已经在数百万张普通图片(如猫和汽车)上学习了无数小时的学生,然后给他们一个关于医学图像的快速速成班。他们还使用数据增强(Data Augmentation),即计算机将现有的少量图片进行人工旋转、翻转或调整亮度,从而创造出“新”的练习图片,让微小的人群感觉像是在一个巨大的体育场里。
3. 尺寸不匹配问题 (The Size Mismatch Problem)
想象一下尝试将一桶沙子与一粒米混合在一起。这桶沙子代表影像数据(可能拥有数百万个像素),而这一粒米代表基因组数据(可能只有几千个数字)。如果你直接把它们倒在一起,计算机会忽略那粒米,只盯着沙子看。这被称为维度不平衡(imbalance in dimensionality),共有 7 项研究应对了这一问题。
- 解决方法: 解决方案是将沙子的桶缩小到米的大小,或者给米一个特殊的“权重”,让计算机注意到它。研究人员使用加权损失函数(weighted loss functions),这就像一名裁判在喊:“嘿,不要忽视那些小数据!它们很重要!”这迫使计算机平等地倾听巨大的图像和微小的基因列表。
4. “黑箱”问题 (The "Black Box" Problem)
即使计算机完美地解决了拼图,它也往往拒绝解释它是如何做到的。在医学领域,这是危险的。如果计算机说:“这位患者患有癌症,”但无法告诉医生为什么,那么医生就无法信任它。这种缺乏**可解释性(interpretability)**的问题在 14 项研究中成为了挑战。
- 解决方法: 科学家们正在为 AI 构建“手电筒”。他们使用像 Grad-CAM 和 SHAP 这样的工具,这些工具可以高亮显示计算机在做出决策时观察了 X 光片的哪些部分或哪些特定的基因。这就像是计算机在 X 光片的可疑位置画了一个圈,并说:“我看到了这个,所以我做了这个选择。”
5. 混合策略问题 (The Mixing Strategy Problem)
最后,有一个关于如何混合数据的问题。是应该先将原始碎片混合在一起(早期融合/Early Fusion),还是在它们被部分解决后进行混合(中间融合/Intermediate Fusion),或者是分别解决它们并在最后阶段合并答案(后期融合/Late Fusion)?研究发现,69 项研究中的 39 项(超过一半)使用了中间融合。
- 解决方法: 这种方法就像拥有一支专家团队。X 光专家和血液检测专家各自先研究自己的线索,然后在得出最终决定前聚在一起交换意见。这似乎比在开始时混合一切或等到最后才混合效果更好。
这篇论文说了什么(以及没说什么)
作者们非常谨慎,并未宣布取得彻底胜利。他们发现,虽然有很多聪明的技巧,但没有任何一种方法是适用于每种疾病或每种数据类型的“灵丹妙药”。最好的解决方案完全取决于你试图解决的具体拼图。
他们还明确排除了一些想法。例如,他们指出,如果只是不加思考地将所有数据粘贴在一起(一种被称为“早期融合”的方法),当数据类型差异太大时(比如将视频与电子表格混合),通常会失败。他们还指出,许多研究依赖于公开数据集(例如,用于 18 项研究的阿尔茨海默病神经影像计划,或用于 8 项研究的癌症基因组图谱)。虽然这些数据集非常适合测试,但论文指出,过度依赖它们可能意味着我们并没有在真实医院中发现的杂乱、真实的现实世界数据上测试我们的想法。
此外,论文强调了一个令人担忧的差距:只有 69 项研究中的 19 项(27.5%)同时分享了他们的数据和计算机代码。这意味着对于大多数这些聪明的解决方案,其他科学家无法轻易检查其工作或在其基础上进行构建。作者们建议,该领域需要更加开放,就像分享一份食谱,而不仅仅是展示最终的蛋糕。
底线结论
这篇综述表明,我们正在取得进展,但道路依然坎坷。最频繁出现的问题是数据缺失和缺乏足够的样本来进行学习。目前最有前景的工具涉及教计算机如何猜测缺失的部分、从其他任务中借鉴知识,以及使用“手电筒”来观察它们的思维过程。
论文总结道,未来不在于寻找一种完美的算法。相反,在于构建灵活的系统,使其能够处理缺失的碎片、在微小的人群中工作,并解释其推理过程。正如作者所言,目标是从仅仅“制作模型”转向制作那些稳健、可靠且准备好在真实医院中帮助真实医生的模型。在那之前,拼图仍然是一个正在进行的工程,但我们确实在变得越来越擅长寻找这些碎片。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。