Reconstructing sequence-grammar trajectories enables interpretable and tunable cis-regulatory element design
本文提出了 GO-CRE,这是一个可解释的深度学习框架,它结合了混合 Transformer-Mamba2 模型、强化学习以及序列-语法轨迹重构,旨在设计并实验验证具有增强活性和特异性的多样化、细胞类型特异性顺式调控元件。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在每一个细胞内部,都有一座庞大的指令图书馆,指导着生命的运作。然而,这座图书馆中最关键的部分并非基因本身,而是被称为顺式作用元件(cis-regulatory elements)的短小、类似开关的 DNA 片段。这些片段充当着调光开关和开/关按钮,告诉特定的基因何时开启、何时“高歌”以及在哪些类型的细胞中运行。如果没有它们,肝脏细胞就无法知道如何过滤毒素,血液细胞也无法知道如何携带氧气。几十年来,科学家们已经能够读取这些开关,但要从零开始设计新的开关来控制细胞以进行治疗或研究,仍然是一个极其艰巨的挑战。这就像是在尝试编写一种新的语言,其语法是隐形的,且规则会根据单词所处的“邻里环境”而改变。
现在,一支研究团队开发出了一种设计这些遗传开关的新方法,将曾经的“黑箱”过程变成了一段透明且可控的旅程。通过构建一个能够观察 DNA 序列在设计过程中如何演化的系统,他们可以清晰地看到生命的“语法”是如何浮现的。这种方法使他们能够创造出在特定人类细胞类型中具有高精准度的合成开关,为工程化控制我们健康的遗传电路提供了更清晰的路径。
由 Mingqian Ma 及其同事领导的研究人员创建了一个名为 GO-CRE 的框架,即“引导优化顺式作用元件”(Guided Optimization of Cis-Regulatory Elements)。为了理解其工作原理,请想象一个计算机程序正试图写出一个句子,使特定类型的细胞产生预期的反应。在过去,科学家会让人工智能生成数千个 DNA 序列,进行测试,并寄希望于其中最好的那些能奏效。这通常是一个试错过程,计算机可能会偶然找到一个看似有效的解决方案,利用简单的重复模式来“欺骗”测试,但并未真正理解生物学本质。新系统改变了这一点,它不再将设计过程视为一场冲向终点的比赛,而是将其视为一张探索旅程的地图。
该方法的核心依赖于一个强大的计算机模型,称为 HybriDNA。该模型在来自数百个物种的海量 DNA 集合上进行了训练,学习了支配遗传信息存储与读取的微妙模式。研究人员随后利用该模型生成新的 DNA 序列,但并未止步于此。他们增加了一层观察机制,追踪计算机在尝试改进序列时所做的每一次微小变化。他们将这些变化分解为微小的构建模块,观察特定字母组合的频率以及已知生物标签的存在如何随时间发生偏移。这使他们能够重建出该序列在演化为功能性开关的过程中所经历的“轨迹”或路径。
当团队在一种被称为 HepG2 的肝细胞类型中观察这些路径展开时,他们发现了一些意想不到的情况:序列陷入了一个陷阱。计算机找到了一个捷径,即创造长段的单一字母重复序列(具体为连续的 G),模型误以为这是一个好的解决方案。这是一种低质量的答案,虽然满足了计算机的评分系统,却未能创造出真正的、具有生物学功能的开关。由于研究人员能够实时观察到这一现象,他们得以介入。他们调整了“游戏规则”,对这些重复字符串施加了惩罚。这一简单的修正重新引导了计算机的路径,使其远离陷阱,转向更复杂且具有生物学意义的解决方案。
这种在设计旅程中途诊断并修复问题的能力,揭示了成功创建这些开关的过程分为三个截然不同的阶段。首先,计算机进行广泛探索,尝试许多不同的组合。接着,它锁定一个特定的方向,锚定一组属于目标细胞类型的生物特征。最后,它对结果进行精细调整,在保持核心特征的同时润色序列。在肝细胞中,系统学会了以精确的顺序组装一组特定的调节标签,从而创建一个紧凑且高效的开关。而在血液细胞(K562)中,它则组装了另一套适合该环境的标签团队。
为了证明这些计算机生成的开关确实有效,研究人员在实验室中进行了测试。他们使用一种无害的病毒将新的 DNA 序列植入活体肝细胞和血液细胞中。随后,他们测量了这些新开关开启荧光报告基因的效果。结果令人瞩目:为肝细胞设计的开关在肝细胞中发出明亮的光芒,但在血液细胞中保持黑暗;反之亦然。这证实了计算机已成功学会了编写细胞类型特异性的指令。此外,新的肝脏开关平均而言比人类基因组中的天然开关更活跃,这表明计算机找到了一种更高效的组织遗传代码的方式。
该研究还强调,并非每种细胞类型都同样容易设计。虽然系统在肝细胞和血液细胞的设计上取得了卓越成功,但在为神经细胞类型创建特定开关时却遇到了困难。在这种情况下,计算机的路径保持着散乱状态,未能沉淀出清晰的模式。这种失败与成功一样具有启发性:它表明系统的表现受限于该特定细胞类型可用数据的质量和数量。这表明,若要让计算机学习某种细胞的语法,它需要一个丰富的案例库进行研究;如果没有足够的数据,设计过程就无法找到稳定的路径。
通过使设计过程变得可视化且可调节,这项工作改变了科学家对待遗传工程的方式。科学家不再是单纯寄希望于获得一个幸运的结果,而是可以观察序列的演化,识别其何时偏离轨道,并将其引导回高效的路径。由此产生的开关并非仅仅是偶然奏效的随机序列,而是经过引导演化的产物,最终收敛为紧凑、高效且高度特异性的生物程序。这种方法为创造未来疗法所需的精确遗传控制提供了强大的新工具,将编写 DNA 这一抽象任务转变为一个具体、可理解且可控的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。