A scalable framework enables phenome-wide association of structural variants in biobank cohorts
作者提出了 KGGSV,这是一个可扩展且安全的端到端框架,成功地将近 50 万个 UK Biobank 基因组中的 368 万个结构变异进行了统一,从而实现了大规模的全表型组关联研究,揭示了数千个显著的 SV-性状关联以及独立于单核苷酸变异的独特结构风险位点。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你的身体是一座宏大而复杂的图书馆,里面包含了构建和运行一个人类的说明书。这本说明书是用一种被称为 DNA 的代码编写的,长期以来,科学家们一直在逐字逐句地阅读它,寻找其中的错别字。这些微小的错别字被称为单核苷酸变异(SNVs),它们就像是一个字母被替换成了另一个(比如用“A”代替了“G”)。这些变异是已经被充分理解的,并已帮助我们破解了许多医学之谜。但 DNA 图书馆不仅仅关乎单个字母;有时,整个段落会被删除,额外的章节会被粘贴进来,或者页面会被颠倒过来。这些被称为“结构变异”(SVs)。它们规模巨大、杂乱无章,而且更难阅读,因为不同的人其“页面”(DNA 链)断裂的位置可能略有不同。
多年来,试图研究大规模人群中这些巨大的结构变化,就像是试图整理一个每本书尺寸都不同、页面松散,且如果尝试同时查看太多书就会导致编目系统崩溃的图书馆。科学家们想要观察这些巨大的结构变化如何影响我们的健康,但他们使用的计算机速度太慢且内存不足,迫使他们放弃了这块拼图中最为复杂的部分。如果没有一种方法来组织这种混乱,我们将错过关于为什么有些人会生病而有些人不会生病的完整图景中的重要部分。
这时,一支新的研究团队决定建立一个更好的图书馆系统。他们创建了一个名为 KGGSV 的工具,它就像一位超级聪明、安全的图书管理员,可以毫不费力地处理数百万本书。KGGSV 并没有尝试一次性阅读所有散落的单页,而是使用了一个巧妙的技巧,叫做 PACKER。想象一下,将成千上万份零散、脆弱的文件全部粘合成一本巨大的、坚不可摧的书,但同时配有一个神奇的索引卡系统。这个索引允许图书管理员瞬间调取特定人群所需的特定页面,而无需实际复制或移动那本沉重的书。这保证了数据的安全与私密,就像一个只在正确的时间为正确的人开启的保险库。
数据组织完毕后,团队使用了另一个名为 PICO 的工具来对结构变异进行分类。可以将 PICO 想象成一名侦探,他不仅观察两个线索之间的距离,还观察这些线索在某个区域内的“密度”。旧的方法就像一个贪心的孩子,只会抓取最近的玩具,如果玩具稍有差异,往往会导致错误。然而,PICO 会观察全局,将相似的结构变化聚集在一起,即使它们略显杂乱或发生了偏移,从而确保最终的列表是准确的,并且不会因为你先看哪本书而改变结果。
利用这个新框架,研究人员应对了一项巨大的挑战:他们分析了来自 UK Biobank 的 490,276 人的 DNA。仅用一台计算机在 13 小时 内,就创建了一个包含 368 万个 结构变异的统一目录。这在以前是极其耗时甚至是不可能的壮举。随后,他们利用这个目录进行了一场巨大的“寻找关联”游戏,将这些结构变异与 877 种不同的健康特征(从身高、体重到哮喘等疾病)进行了比对。
结果是一座宝库。他们发现了 154,506 个结构变异与健康特征之间的显著联系。但最令人兴奋的发现是,这些结构变异讲述了一个单字母变异(SNVs)所遗漏的故事。例如,在哮喘的案例中,他们发现的结构性风险中,约有 35.8% 在旧的方法中是完全不可见的;它们是只有通过观察大规模结构变化才能捕捉到的独特信号。他们还发现,某些结构变异起到了“桥梁”的作用,连接着不同的疾病。例如,他们发现了呼吸系统问题(如哮喘)与消化系统问题(如胃食管反流)之间共同的遗传易感性,这表明相同的 DNA “故障”可以同时削弱我们的肺部和胃部黏膜。
该论文指出,通过使用这种可扩展且安全的全新框架,我们终于可以揭开隐藏在那些杂乱、巨大的 DNA 部分中的秘密。它证明了我们不再需要在速度和准确性之间做选择。虽然这项研究并不声称已经解决了所有的医学之谜,但它明确地确立了这些结构变异是人类多样性和疾病风险的一个主要且此前被忽视的来源,并且只要拥有正确的工具,我们终究能够清晰地解读它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。