OmicsPred as a centralised resource for genetic prediction of multi-omic traits
为了解决多组学插补模型的碎片化问题,作者开发了 OmicsPred,这是一个集中的平台,它将超过 330 万个遗传预测模型与标准化的元数据和格式统一起来,以促进可发现性、互操作性和系统性的靶点发现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正在试图理解为什么有些人会生病,而有些人却能保持健康。科学家们知道你的 DNA(你的遗传蓝图)会影响你的健康,但 DNA 仅仅是说明书。你体内的真正“工人”是像 RNA、蛋白质和代谢物这样的分子。为了真正理解疾病,科学家需要看到这些“工人”正在做什么。
然而,检查数百万人中的这些分子水平是极其昂贵且困难的,就像要检查一座巨大城市中的每一块砖块一样。另一方面,读取人们的 DNA 现在既便宜又容易,就像拥有城市的布局地图一样。
问题:散落在各处的地图图书馆
科学家们已经找到了如何利用 DNA“地图”来预测分子“工人”的行为。他们构建了数以千计的数学公式(预测模型)来做这件事。但直到现在,这些公式一直散落在各处——隐藏在不同的研究论文背后、不同的网站上,或者以不同的文件格式存在。这就像是一个图书馆,里面的每一本书都是用不同的语言编写的,并储存在不同的房间里。如果研究人员想要使用它们,他们必须一个接一个地去搜寻,而且通常无法将它们结合使用。
解决方案:OmicsPred(中央图书馆)
这篇论文介绍了 OmicsPred,这是一个全新的、集中的在线库,它将所有这些散落的预测模型整合到了一个地方。你可以把它想象成一个巨大的、组织有序的仓库,这里面的每一个遗传预测工具都贴好了标签,被翻译成了通用的语言,并且随时可以被借用。
以下是 OmicsPred 的特别之处,我们使用简单的类比来解释:
- 海量收藏: 截至 2026 年 5 月,该图书馆拥有超过 330 万个预测模型。这些模型涵盖了三种主要的分子“工人”:转录本(RNA)、蛋白质和代谢物。
- 标准化格式: 以前,一个来自某项研究的模型可能采用一种只有特定计算机程序才能读取的格式。OmicsPred 翻译了所有这些模型,使它们能与科学家已经在使用的流行工具(如“PGS Calculator”和“MetaXcan”)协同工作。这就像确保图书馆里的每本书都有英文和西班牙文版本,以便每个人都能阅读。
- 详细标签(元数据): 每个模型都附带一张清晰的“身份证”。这张卡片会告诉你该模型的训练来源(哪组人群、哪种组织)、它的准确度以及它预测的具体分子是什么。
- 连接点滴: 这个图书馆不仅仅是列出模型;它还将模型与生物学“邻里”(通路)联系起来。例如,如果你查询一种蛋白质,图书馆可以显示在同一个生物过程中与该蛋白质共同工作的其他蛋白质有哪些。
实战演练:百万退伍军人计划
为了展示这个库的实用性,研究人员使用 OmicsPred 分析了来自**百万退伍军人计划(MVP)**的数据,这是一项针对超过一百万名具有多样化背景的人群的大规模研究。
他们利用该库进行了一次大规模的“搜索与发现”行动(称为 PheWAS)。他们问道:“如果我们根据 DNA 来预测这些数百万个分子的水平,哪些分子会与特定疾病相关联?”
- 结果: 他们发现了超过 19 万个显著关联,这些关联存在于预测的分子特征与疾病之间。
- 现实世界案例: 他们证实了已知的联系,例如特定的蛋白质(PCSK9)与心脏病之间的联系。
- 新见解: 他们发现了一个名为 AGER 的分子与甲状腺功能减退症(甲状腺功能低下)之间存在非常一致的联系。这一发现在不同的人群和不同类型的数据中都被证实了。通过使用该库的“邻里”地图,他们看到 AGER 是一个特定的信号通路(NF-κB)的一部分,而该通路已知对甲状腺健康非常重要。这有助于解释这种联系存在的原因。
未来展望
作者强调 OmicsPred 是一个不断发展的资源。目前,大多数模型是基于欧洲血统的人群,但团队致力于随着更多多样化全球人群模型的出现而增加这些模型。他们还计划将该库扩展到包括家畜模型,并添加更先进的功能,以帮助科学家确定因果关系。
总结
OmicsPred 是一个集中的、用户友好的枢纽,解决了遗传预测工具分散的问题。它允许研究人员轻松地查找、下载并使用数以千计的模型,通过 DNA 来预测分子特征,从而帮助他们发现我们的基因、我们的生物学功能以及疾病之间的新联系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。