Scalable penalized regression boosts accuracy and computational efficiency for single- and cross-ancestry polygenic prediction
本文介绍了一种由尖峰与板式 Lasso 惩罚回归(Spike-and-Slab Lassosum, SSL)及其先验信息引导的扩展版本(pSSL)组成的规模化惩罚回归框架,该框架在显著提升单祖系及跨祖系多基因评分的预测准确性与计算效率的同时,还解决了基因组研究中的欧洲中心主义偏差问题。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图仅仅通过观察一个人的 DNA,来预测他是否可能患上复杂的疾病,比如糖尿病或心脏问题。科学家们使用一种“多基因评分”(Polygenic Score, PGS),这基本上是一个巨大的数学方程,它累加了成千上万个微小的遗传线索。但问题在于,构建这些方程的过程一直有点混乱。那些超精确的方法就像是沉重且缓慢的坦克,计算速度极慢,而且会耗尽你所有的计算机内存。而那些快速的方法则像是轻便的踏板车,但它们往往会忽略大局,或者在数学计算上出错。此外,大多数这些“坦克”都是利用欧洲血统的人群数据构建的,所以当你尝试在东亚、非洲或南亚人群的道路上驾驶它们时,它们经常会“翻车”。
于是,一支新的研究团队构建了一辆既像坦克一样强大的“智能踏板车”。他们将这些新工具称为 SSL(针对单一人种)和 pSSL(针对跨人种)。
魔术技巧:“尖峰”收缩(The "Spiky" Shrinkage)
把遗传线索(SNPs)想象成一群正在大声喧哗的人。有些人是在大声喊出重要的真相(强遗传效应),而大多数人只是在低声细语,制造噪音(弱效应或无效应)。
旧的快速方法对所有人一视同仁,将所有的声音都以相同的程度进行收缩。这就像是要求摇滚明星和安静的图书管理员都以同样的音量说话一样。你会因此丢失摇滚明星的信息!
新的 SSL 方法使用了一种被称为“尖峰-平板”(spike-and-slab)惩罚的方法。想象一个神奇的过滤器,它扮演着一个保安的角色。它让那些响亮、重要的声音(“平板/slab”)几乎不受影响地通过,但它会激进地让那些微弱的细语(“尖峰/spike”)保持沉默,直到它们消失。这让模型能够保留强信号,同时忽略噪音,从而使其更加准确。
超能力:借用大脑
现在,如果你想为一个研究较少的人群(如东亚人)预测疾病风险,但你手头有一个研究充分的人群(如欧洲人)的海量数据,该怎么办?
旧的方法要么直接忽略欧洲数据,要么试图笨拙地将它们混合在一起。新的 pSSL 方法就像是一个拥有优秀导师的学生。它获取“导师”的笔记(欧洲遗传数据),并将其作为提示,来帮助学生解决问题(目标人群)。它并不只是单纯地复制导师,而是利用导师的知识来填补学生自己笔记中的空白。这被称为“迁移学习”。
竞赛:速度 vs. 准确度
研究人员通过两种方式对这些新工具进行了测试:一种是在计算机模拟中,另一种是在来自英国生物样本库(UK Biobank)和中国东丰同济(DFTJ)队列的真实世界数据中。
在模拟实验中:
他们创建了 11 种不同的“假设情况”,每种情况都有不同的遗传规则。
- 结果: SSL 在 11 种场景中的 6 种 中排名第一,并在另外 2 种 场景中排名第二。虽然它并不是在所有情况下都最快(像 C+T 和 Lassosum 这样的方法在技术上更快),但它比那些追求速度的方法要准确得多。
- 速度: 对于其准确度水平而言,SSL 的效率极高。它运行大约需要 32.5 分钟,而著名的贝叶斯方法 PRS-CS 则需要 120.7 分钟。SSL 仅使用了 9.0 GB 的计算机内存,而 PRS-CS 则吞噬了 54.3 GB。这就像是在开着跑车跑马拉松,而其他选手却在推着沉重的推车。
- 准确度: 在来自英国生物样本库的真实数据中,SSL 比 PRS-CS 的预测准确度平均提高了 7.8%。在中国的 DFTJ 队列中,这种提升甚至更大,达到了 10.4%。
在跨人种测试中:
当他们尝试使用东亚和欧洲数据的混合数据来预测东亚人的特征时:
- pSSL 在测试的 32 个特征中,有 71.9%(23 个)排名第一。
- 它比目前的顶级跨人种方法 PRS-CSx 平均高出了 12.3%。
- 它在预测血细胞计数和脂质水平(如胆固醇)方面表现尤为出色。
他们 没有 发现的内容(“禁区”)
了解这项研究中哪些内容是无效或尚未被证明的非常重要:
- 它不是万能灵药: 论文明确指出,没有任何一种方法在每一次测试中都获胜。例如,在针对不同人群的哮喘研究中,新方法仅比旧的单一人种方法平均提高了 0.3%。作者认为这是因为不同人群之间的哮喘遗传学差异非常大,因此“借用”欧洲数据并没有起到什么作用。
- 它还不适用于所有人: 新的跨人种工具(pSSL)目前是为 两个 人群同时设计的(一个目标人群,一个辅助人群)。论文认为,现在尝试同时混合 许多 个人群会使计算机数学运算变得过于缓慢和复杂,且不会带来更好的结果,因为数据量最小的那个群体会拖累整体。
- 它对小规模群体并不完美: 如果你研究的人群规模非常小(例如研究对象仅为 10,000 人),“噪音”有时可能会压倒“信号”,导致该方法并非绝对最优。
总结
研究人员表示,他们构建了一个终于平衡了速度与智慧的工具。他们通过模拟和真实数据表明,你不需要在缓慢准确的方法和快速不准确的方法之间做出选择。SSL 和 pSSL 似乎提供了最好的折中方案,使得为多样化人群创建准确的遗传预测成为可能,而无需等待几天时间让计算机完成计算。
然而,论文谨慎地指出,这是一个重大的进步,而非终点。他们仍需研究如何更好地处理更小的样本量,以及如何随着更多数据的出现,最终实现同时混合多个以上的人群。不过,就目前而言,他们已经为遗传预测的未来打造了一个更快速、更智能的引擎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。