← 最新论文
🧬 biology

OmicFormer: a statistical priors–informed transformer for accurate and generalizable omics prediction of diseases and complex traits

OmicFormer 是一种新型的基于 Transformer 的架构,它通过嵌入统计先验来捕捉复杂的生物依赖关系,在多种疾病预测任务和组学数据集上的准确性和泛化能力方面显著优于现有方法。

原作者: Weikang Gong, Hanlin Jiang, Chang Yang, Menghan Qin, Jia You, Jianfeng Feng, Jin-Tai Yu, Wei Cheng

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Weikang Gong, Hanlin Jiang, Chang Yang, Menghan Qin, Jia You, Jianfeng Feng, Jin-Tai Yu, Wei Cheng

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正试图预测未来,但你不是在通过水晶球,而是在观察一份巨大的生物学数据电子表格。这就是“组学”(omics)的世界——在这个领域,科学家们收集来自我们身体的庞大测量列表,比如血液中漂浮的数千种蛋白质、代谢中的数百种化学物质,或是我们大脑布线的详细图谱。把这些列表想象成一个混乱的图书馆,其中的每一本书都代表了你生物学的一个微小部分。精准医疗的目标就是阅读这些书,以预测某人未来是否可能患病(如糖尿病或心脏病),从而让他们能够及早获得帮助。

然而,阅读这个图书馆是非常困难的。书本是杂乱无章的,书与书之间的联系非常复杂,而且信息往往散落在数百页之中。长期以来,科学家使用标准工具来处理这些数据,这有点像使用一本简单的规则手册在干草堆中寻找针头。这些工具虽然不错,但往往会错过身体不同部分之间微妙的、长距离的联系。当数据发生轻微变化时(例如在比较不同医院的患者时),它们也会表现得力不从心。这就是一个新想法出现的地方:如果我们能教会计算机不仅仅是阅读书籍,而是理解它们共同讲述的故事,利用我们生物学实际运作方式中的隐藏模式,情况会怎样?

这正是 OmicFormer 背后的研究人员致力于做的事情。他们构建了一种新型的人工智能(AI),专门用于理解这些杂乱的生物学电子表格。OmicFormer 并没有将每一条数据视为孤立的事实,而是使用了一个巧妙的技巧,在开始学习之前就对数据进行组织。想象一下你在学习一门新语言。如果你只是按字母顺序背诵词典,很难看出单词之间的关系。但如果你重新排列词典,让经常一起使用的词(如“咖啡”和“杯子”)放在一起,规律就会变得显而易见。OmicFormer 做的是类似的事情。它使用两个“统计先验”(这只是一个基于数学的聪明猜测),来重新排列生物学数据。

首先,它根据每项数据预测特定疾病的可能性来进行排序。其次,它使用一种复杂的数学映射(称为 Gromov–Wasserstein 最优传输),将自然聚在一起的生物特征(例如在同一个团队中工作的蛋白质)归为一组。通过将这些整齐组织后的数据输入到一个名为“Transformer”的强大 AI 引擎(这种技术同样用于帮助聊天机器人理解人类对话)中,该模型可以发现其他方法无法察觉的联系。这就像是给 AI 提供了一张显示哪些书相关的图书馆地图,而不是仅仅要求它去猜测。

研究团队在来自 UK Biobank 的大规模数据集上测试了这种新 AI,该数据集包含了约 50 万人的信息。他们要求 OmicFormer 利用蛋白质、代谢和脑部扫描数据,来预测 450 种不同疾病的风险,并估算 900 种不同的健康特征。结果令人印象深刻。OmicFormer 一致地优于现有的最佳工具,包括科学家多年来一直依赖的流行的“基于树”的方法。例如,在利用蛋白质数据预测疾病时,OmicFormer 比次优方法提高了约 3.5% 的准确率。虽然这听起来可能很小,但在预测罕见或复杂疾病的世界里,这是一个巨大的飞跃,可能意味着在问题被发现早期还是被漏掉之间有着本质的区别。

这项发现更令人兴奋的地方在于它处理现实世界复杂性的能力。研究人员不仅在训练数据上测试了它,还将它投入到了完全不同的数据集中。他们在来自全球神经退行性疾病蛋白质组学联盟(Global Neurodegeneration Proteomics Consortium)的一组不同人群,以及来自世界各地不同医院的脑部扫描数据上进行了测试。在这些“陌生”环境中,尽管数据看起来略有不同,OmicFormer 并没有出错。它持续表现得比旧方法更好,这表明它学习的是生物学的“规则”,而不仅仅是记住了它所展示的具体案例。这至关重要,因为在医学领域,一个只在一家医院有效的工具是没什么用处的。

研究人员还观察了 AI 是如何做出决策的,以确保它不仅仅是在瞎猜。他们发现 Omic1Former 强调了医生已知重要的生物标志物,例如与心脏病或炎症相关的特定蛋白质。这让科学家们相信,AI 发现的是真实的生物信号。此外,他们还展示了通过教 AI 同时观察多种疾病(一种称为“多任务学习”的技术),它可以通过借鉴更常见疾病的知识,来更好地预测罕见状况。

简而言之,OmicFormer 表明,通过尊重生物数据的自然结构并在分析前进行智能组织,我们可以构建出不仅更准确,而且在应用于不同人群时更可靠的 AI 模型。它并不声称已经解决了所有的医学奥秘,但它提供了一种阅读我们健康复杂故事的强大新方法,有望为广泛的疾病带来更好的预测和更早期的干预。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →