← 最新论文
🧠 neurology

Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts

这项研究表明,深度学习基因组预言器无法在不同的宿主背景下泛化序列效应,因为它们对调控元件活性的预测高度依赖于特定的基因组位置,且无法仅通过序列特征进行可靠预测。

原作者: Selahattin Alperen Uysal

发布于 2026-09-21✓ Author reviewed ⓘ
📖 1 分钟阅读☕ 轻松阅读

原作者: Selahattin Alperen Uysal

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在浩瀚的人类基因组景观中,某些 DNA 片段充当着开关的角色,通过开启或关闭基因来控制细胞如何运作。科学家们长期以来一直试图理解那套告诉这些开关在哪里工作以及何时激活的精确代码。近年来,强大的计算机程序已经出现,以帮助解码这种语言。这些程序通常被称为“基因组预言机”(genomic oracles),它们可以观察一段 DNA 字母序列,并预测其在活体细胞内的行为,估算其是会开放以允许基因活动,还是保持关闭状态。由于与实验室实验相比,这些数字工具既快速又廉价,研究人员越来越多地利用它们来设计新的 DNA 序列,希望能创造出完全符合预期用途的定制开关。其背后的基本希望是,如果一个计算机程序说某段特定的 DNA 序列在基因组的某个部分是一个优秀的开关,那么即使将其移动到不同的位置,它仍将是一个优秀的开关。

一项新的研究挑战了这一基本假设,该研究测试了当相同的 DNA 序列被放置在基因组的不同区域时,这些数字预测是否依然成立。研究人员将重点放在多发性硬化症上——这是一种免疫系统攻击神经系统的疾病——并观察了已知会增加患病风险的特定遗传区域。他们使用人工智能模型生成了数千个候选 DNA 序列,这些序列看起来像是可以在免疫细胞中发挥调节开关作用。随后,他们使用基因组预言机对这些候选序列进行评分,选择了计算机预测最活跃的那些序列。接着,团队进行了一项严格的测试:他们将完全相同的选定序列放置在基因组内的二十四个不同位置,以观察计算机的预测是否保持一致。

结果显示出令人震惊的缺乏一致性。虽然计算机程序可以在单一位置内对序列进行良好的排序,但当序列被移动时,其预测就失效了。对 DNA 序列进行的特定改变并不是序列本身的固定属性;相反,它完全取决于该序列在基因组中的位置。在某些位置,对 DNA 进行特定编辑会使序列变得更活跃,而在其他位置,完全相同的编辑却会使序列活跃度降低或完全没有影响。研究人员发现,序列的行为对周围环境的依赖程度极高,以至于不同位置之间的差异巨大,在近一半的测试位点中,效应甚至发生了方向性的逆转。

为了理解计算机究竟在“看到”什么,团队对 DNA 序列进行了直接干预。他们测试了计算机的偏好是由已知控制基因的蛋白质结合位点的存在驱动的,还是由这些位点的密度驱动的。答案是否定的;移除这些位点或改变其数量并不会以可预测的方式改变计算机的评分。相反,真正起作用的因素是被称为 CpG 的特定化学结构的内容,这涉及两个 DNA 字母的配对。然而,即便这一因素也并非孤立起作用。增加 DNA 中这种结构的数量在某些基因组位置会提高评分,但在其他位置则会降低评分。效应的方向是由宿主位置决定的,而非由编辑本身决定。

研究还测试了第二个独立训练的计算机程序是否会产生相同的结果。这个基于不同架构并在不同数据上训练的新模型证实了主要发现:DNA 编辑的效果高度不稳定,并随基因组位置的不同而剧烈变化。然而,这两个程序在“哪些位置会出现正向或负向效应”的具体细节上并不一致,这表明虽然这种不稳定性是一个真实的现象,但模型解释位置的具体方式是每个模型所特有的。

或许最关键的是,研究人员检查了计算机选择的序列在现实世界的实验中是否表现更好。他们将计算机的评分与涉及数千个 DNA 元件的大规模实验室测定所得出的实际活性进行了对比。计算机的选择标准无法预测哪些序列在细胞中真正活跃。事实上,计算机评定为表现最佳的序列往往在实验室中表现出相反的行为,即那些最特异且最活跃的元件,在预言机中得到的评分反而最低。这种脱节表明,计算机所优化的特定目标并不反映 DNA 实际的生物学活性。

研究人员还发现,一种基于统计 DNA 字母模式的更简单的数学方法,就能生成与复杂的深度学习人工智能模型同样出色的序列。这种简单的算法不需要强大的计算机,且能在数秒内拟合完成,它在所有测试指标上都达到了与先进神经网络相当的表现。这一发现意味着,在这种语境下,深度学习模型的复杂性对于捕捉 DNA 序列的核心模式而言并非必要。

最终,研究结论指出,基因组预言机所学习或测量的序列级效应,并不是序列本身的属性。它是序列与其所处的特定基因组环境相结合后的属性。这种对位置的依赖性无法通过周围 DNA 的简单、廉价特征来预测。对于设计新遗传元件的科学家来说,这意味着在一个位置经过设计并验证的模拟序列,一旦移动或插入他处,其行为将无法得到任何保证。这些研究结果提醒人们,尽管这些强大的数字工具非常有用,但在没有针对多个位置进行直接实验验证的情况下,目前还不能完全信任它们来预测设计好的序列在人类基因组多样化景观中的行为。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →