GenFAR: A generalized representation of brain structure, derived from 49,246 multi-cohort MRIs via deep learning
GenFAR 是一个模块化深度学习框架,通过对 49,246 份多队列脑部 MRI 进行序列化训练,以推导出一种广义的、具有临床启发性的表征,从而显著提高了下游神经影像任务的样本效率和准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人理解人类的大脑。多年来,科学家们一直在构建“专家型”机器人:一个擅长发现肿瘤,另一个擅长猜测年龄,第三个则只能判断血压是否偏高。这些专家在自己的领域表现出色,但它们却完全无法分享彼此所知。如果你想建立一个新的机器人来预测另一种疾病,你必须从零开始,收集大量的资料并重新训练它。这既缓慢又昂贵,而且如果你的数据量达不到数百万份脑部扫描图像,这往往是无法实现的。
目前的医学影像领域正困于这种“专家模式”。然而,在人工智能的其他领域(如语言或照片),科学家已经开始构建“基础模型”——即巨大的、通用的大脑,它们先学习广泛的模式,然后可以针对特定任务进行微调。脑科学研究人员面临的一个重大问题是:我们能否为医学扫描构建一个类似的通用大脑?如果我们能做到这一点,那么即使面对极少量的全新数据,我们也能够进行学习,因为该模型已经理解了大脑外观及其变化的各种基本规律。这就是这篇论文所探讨的挑战:创建一个单一的、智能的系统,让它能同时从许多不同的脑部相关任务中学习,从而帮助医生和科学家更快、用更少的数据解决新问题。
遇见 GenFAR,一种新型的“大脑之脑”,它就像是一个医学图像的超级图书管理员。研究人员并没有雇佣 17 个不同的专家来阅读 17 本不同的书,而是构建了一个庞大的、模块化的图书馆,让它同时阅读所有的书。他们向这个系统输入了来自 11 个不同人群群体的 49,246 份脑部 MRI 扫描图像,教会它预测从一个人的年龄、受教育程度到是否患有糖尿病、高血压或早期阿尔茨海默症等各种情况。
研究人员尝试了两种不同的训练方式。第一种方式就像让 17 名学生在各自独立的房间里学习;他们读的是同样的书,但彼此无法交流。这种方式效果尚可,但效率低下。第二种方法最终成为了获胜者,它就像一场接力赛。在这种“顺序式”方法中,学生们按特定的顺序学习。第一个学生从原始脑部扫描中学习,并将笔记传递给第二个学生,后者再加入自己的见解,以此类推。当笔记传到最后一名学生手中时,他们已经拥有了一份关于大脑所能提供信息的极其丰富且深刻的总结。
团队发现,完美的接力队规模是六名学生。如果他们尝试在队伍中增加更多学生,笔记就会变得混乱且难以理解(这是一个被称为“过拟合”的问题),最终的总结也会变得不够准确。他们还弄清楚了哪些学生是最好的“知识捐赠者”。诸如预测年龄、阿尔茨海默症/轻度认知障碍、记忆测试评分(MMSE)以及高血压和高脂血症等任务是其中的佼佼者。这些任务提供了对其他任务最有用的信息。事实上,学习一个人的年龄是非常有帮助的,它提升了该模型尝试解决的几乎所有其他任务的表现。
GenFAR 的魔力不仅在于它学到了这些知识,更在于它如何将这些知识应用到从未见过的新问题上。研究人员通过隐藏一个任务(例如预测吸烟状态),并观察仅在其他任务上训练的模型是否仍能正确猜测该任务,以此进行了测试。结果令人印象深刻:顺序式模型的表现优于直接针对该特定数据进行训练的模型。更重要的是,该模型具有极高的“样本效率”。通常情况下,深度学习需要数千个样本才能学会一项新技能,而 GenFAR 却能仅用 100 到 500 个样本就学会新任务,相比之下,标准模型在如此少量的数据面前会表现不佳甚至失败。
论文明确排除了“学习序列越长总是越好”的观点;他们发现,一旦超过六个任务,性能反而会下降。他们还发现,并非所有的任务都是有益的捐赠者;尝试从“总 Tau 蛋白脑脊液”(一种特定的蛋白质标记物)或“吸烟”等任务中学习,实际上会让模型的表现变差,这可能是因为数据不足,或者大脑信号过于微弱而无法发挥作用。作者对他们的发现非常有信心,他们测试了 5,000 个随机序列,以证明六个任务是最佳平衡点,并且“捐赠者得分”(Donor Score)这一指标能够准确预测哪些任务是有益的,哪些是有害的。
最后,研究人员并没有将这个工具据为己有。他们向公众发布了该模型和代码,让任何人都能在不需要超级计算机的情况下,从脑部扫描中提取这些强大的、通用的特征。通过将一堆零散的、单一用途的模型转变为一个凝聚的、能够共享知识的系统,GenFAR 表明,医学影像的未来在于那些先进行广泛学习的模型,这样它们就能以比我们想象中更少的数据,帮我们揭开大脑的奥秘。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。