← 最新论文
💻 bioinformatics

pydreg: a fast Python package for identifying active cis-regulatory elements from nascent transcription

本文介绍了 pydreg,这是一个对 dreg 算法进行的快速且易于维护的 Python 重实现,用于从新生转录中识别活跃的顺式调控元件,它在保持原方法准确性及与现代计算基础设施兼容性的同时,显著降低了运行时间和内存消耗。

原作者: He, A. Y., Danko, C. G.

发布于 2026-09-13
📖 1 分钟阅读☕ 轻松阅读

原作者: He, A. Y., Danko, C. G.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在人体内的每一个细胞中,一套复杂的开关系统决定着哪些基因被开启,哪些基因被关闭。这些被称为调控元件的开关就像是细胞运作的控制面板,决定了何时构建特定的蛋白质,以及何时停止。为了了解细胞如何运作,科学家必须定位这些活跃的开关。寻找它们的一种强大方法是倾听细胞原始、未经处理的遗传信息。当一个基因正在被读取时,细胞会产生一种被称为新生 RNA(nascent RNA)的短寿命 RNA 副本。通过对这种新鲜的 RNA 进行测序,研究人员可以精确地看到细胞当前活跃的位置,从而揭示驱动生物过程的启动子和增强子的位置。

十多年来,一个名为 dREG 的计算机程序一直是寻找这些活跃区域的标准工具。它通过扫描整个基因组上的 RNA 产生模式,寻找开关被拨动的特定特征信号。然而,该软件的原始版本是基于已经变得难以运行和维护的旧技术构建的。它依赖于一种复杂的编程语言组合和专门的硬件支持,而这些技术现在已不再容易更新。因此,许多想要使用这种强大方法的科学家发现自己被技术障碍所阻挡,无法在自己的电脑上运行分析,也无法将其集成到现代研究工作流中。

为了解决这个问题,研究人员 Adam Y. He 和 Charles G. Danko 开发了名为 pydreg 的新版软件。他们用 Python(一种广泛使用且易于维护的语言)重写了整个程序,同时保留了使原始工具如此精确的完全相同的数学逻辑。其目标不是改变科学原理,而是让工具变得更快、更轻量,并且让任何人都能更轻松地使用。新软件保留了程序的原始“大脑”——即识别活跃基因模式的预训练模型——但将底层沉重且过时的机械结构替换成了现代、高效的工具。

当团队将新软件与旧版本进行对比测试时,结果在准确性方面几乎完全一致。新程序识别出的活跃区域具有极高的吻合度,以至于两组结果几乎无法区分。事实上,在对数百万个潜在位置进行评分对比时,新软件与旧软件的相关性之强,几乎达到了完美的程度。这证实了新代码并没有丢失原始方法的任何科学精度。区别完全在于完成工作的方式。新版本的运行速度比旧版本快了约四点五倍。它还显著减少了对计算机内存的使用,仅需原先所需资源的一小部分。

速度和效率的提升源于新软件处理繁重计算的方式。原始程序使用了一种定制的旧方法来处理图形卡上的数据,该方法是为十多年前的硬件设计的。新版本则使用现代库,充分利用当前的计算机芯片,使其能以更小的代价完成同样的复杂计算。它还简化了主计算前后所执行的步骤,减少了计算机等待数据的时间。对于研究人员而言,这意味着原本可能需要数小时的分析现在可以在极短的时间内完成,并且可以在标准设备上运行,而不再需要专门且难以寻找的配置。

除了速度之外,新软件还消除了阻碍许多科学家使用该方法的障碍。它被封装为一个简单的工具,可以通过单条命令进行安装,并能与基因研究中使用的其他现代工具无缝衔接。开发者还将底层代码和预训练模型免费公开,确保该方法保持开放性,并能由社区在未来进行改进。通过在不改变科学原理的情况下更新基础设施,研究人员延长了这一关键工具的生命周期,确保了绘制基因组活跃开关的能力对每一位需要它的人都是可及的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →