ChromBPNet: bias factorized, base-resolution deep learning models of chromatin accessibility reveal cis-regulatory sequence syntax, transcription factor footprints and regulatory variants
ChromBPNet 是一种轻量级、碱基分辨率的深度学习模型,它通过将实验特异性偏差与调控信号进行解耦,从而稳健地解码转录因子结合语法、生成精确的足迹,并优先识别影响染色质可及性和复杂性状的功能性遗传变异。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在几乎每一个人类细胞的细胞核内,DNA 并非松散的线条,而是紧密缠绕的包裹。为了读取隐藏其中的遗传指令,细胞必须首先解开这些包裹,使特定的 DNA 区域能够被控制基因活动的机制所接触。科学家们可以使用强大的实验室技术来观察这些开放且可及的区域,这些技术就像聚光灯一样,照亮了目前处于活跃状态的基因组部分。这些活跃区域被称为调控元件,是被称为转录因子的蛋白质结合到 DNA 上以开启或关闭基因的地方。了解究竟是哪些 DNA 序列允许这些蛋白质结合,以及人与人之间的遗传差异如何改变这种结合,对于理解性状是如何形成以及疾病为何发生至关重要。然而,科学家从这些实验中捕获的信号往往充满噪声,并且会被用于测量它们的工具本身所扭曲,这使得很难将真实的生物信号与技术伪影区分开来。
一项新的研究引入了一个名为 ChromBPNet 的复杂计算机模型,旨在穿透这些噪声,揭示支配 DNA 可及性运作的精确规则。研究人员在海量的人类细胞数据上训练了这个人工智能系统,教它仅根据遗传字母的序列来预测 DNA 可及性的精确模式。该模型以最高的解析度运行,逐个字母地观察基因组。ChromBPNet 的一个关键创新在于它能够将真实的生物学故事与实验中所使用的酶引入的技术失真区分开来。在像 ATAC-seq 这样使用转座酶来标记开放 DNA 的实验中,酶本身对某些 DNA 序列具有偏好性,这种偏好会产生一种看起来像是蛋白质结合位点、但实际上只是酶自身特性产生的偏差。ChromBPNet 学会了识别并减去这些酶的偏好,从而留下了一张关于转录因子真实与 DNA 相互作用的高保真、清晰的图谱。
通过应用这种偏差校正,研究人员发现控制可及性的遗传代码出奇地精简。他们发现,一组相对较小的转录因子基序(即结合模式)通过特定的排列组合,就足以解释染色质如何在不同类型的细胞中开放。该模型显示,这些因子通常以协作团队的形式共同工作,其中它们结合位点之间的间距和方向受到严格调节。例如,该模型识别出了特定的复合元件,在这些元件中,两种不同的蛋白质必须以精确的配置进行结合才能驱动可及性,而这是以往的方法经常忽略的细节。此外,该模型甚至能从遗传物质含量极低的实验数据集中,成功重建高分辨率的蛋白质足迹图(即蛋白质物理保护 DNA 时留下的微小空隙),这在以前如果不依赖大量的测序数据是无法实现的。
ChromBPNet 的力量延伸到了理解遗传变异如何影响健康领域。研究人员测试了该模型预测数百万个遗传变异(包括与复杂性状和罕见疾病相关的变异)的能力。该模型能够准确预测单个 DNA 字母的变化将如何改变一个区域的可及性,其表现往往优于那些在多样化数据集上训练过的更大、更复杂的深度学习模型。至关重要的是,该模型能够解释一个变异产生影响的“原因”,它能精准定位是哪个蛋白质结合位点被破坏了,以及因子之间的协作语法是如何被打破的。在一个引人注目的例子中,该模型识别出一位患有严重神经发育障碍患者的一个罕见遗传变异,该变异创造了一个新的抑制蛋白结合位点,从而有效地关闭了一个对大脑发育至关重要的基因。研究人员在实验室中验证了这一预测,证明该风险等位基因确实消除了发育中的小鼠大脑中该 DNA 区域的活性。
这项工作为解码调控基因组提供了一个强有力的全新视角。通过将生物信号与实验的技术噪声剥离开来,ChromBPNet 为控制我们细胞的遗传语法提供了一个更清晰、更准确的视图。它证明了深度学习模型可以既轻量又高度精确,能够跨越不同的细胞类型、祖先群体和实验条件进行泛化。研究表明,支配基因调控的规则比此前认为的更加一致且易于解读,为识别驱动人类性状和疾病的具体遗传变化提供了一个稳健的框架。随着这些模型的不断完善和应用,它们有望改变研究人员解读庞大遗传变异景观的方式,将复杂的数据转化为具有实际意义的生物学洞察。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。