Information-theoretic profiling of structural organization in human genes
本研究采用一种基于库尔贝克-莱布勒(Kullback–Leibler)聚类熵的信息论聚类框架,来分析参与表观遗传调控和神经发育障碍的特定人类基因的结构组织,证明了所得出的熵谱在比较基因组学和功能基因特征化方面是稳健且有用的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
人类基因组是一个巨大的图书馆,包含了构建和运行一个人类的指令。它是由由四个字母组成的化学代码编写而成的,这些字母代表了DNA的构建模块。几十年来,科学家们一直专注于阅读这本“书”中的特定词汇——即编码蛋白质的基因——以了解生命是如何运作的。然而,这些词汇之间的空格以及字母在词汇内部排列的方式,隐藏着另一种秘密。这些区域并非仅仅是空的填充物;它们包含了复杂的组织模式,有助于控制基因何时以及何处开启或关闭。为了理解这些隐藏的结构,研究人员正转向一个最初用于衡量信息量和不确定性的数学分支。通过将DNA序列视为数据流,他们可以寻找统计模式,从而揭示遗传代码是如何组织的,而无需将其与其他物种的序列进行比对或对齐。这种方法使他们能够观察基因组的“纹理”,识别出那些表现出高度有序性与那些看起来较为随机的区域。
在最近的一项研究中,来自意大利都灵理工大学的研究人员将这种基于信息的方法应用于五个特定的、已知参与调节DNA包装和读取过程的人类基因。这些基因被称为 ASH1L、NSD1、NSD2、NSD3 和 SETD2,它们对于发育至关重要,且在功能失调时与各种疾病相关。该团队希望观察这些基因的数学“指纹”是否能揭示其内部结构。他们首先将长串的DNA字母转换为一系列数字。为了公平起见,他们根据化学形状将DNA字母分为两类:具有两个环的和具有一个环的。这为每个基因创建了一个平衡的数值图谱,范围从基因的起始处延伸到前后一千个字母,以确保捕捉到周围的调节环境。
研究人员通过在序列上滑动窗口来分析这些数值图谱,每次观察一小段序列。对于每个片段,他们测量字母如何聚集在一起,并将该模式与一组计算机生成的模型进行比较。这些模型代表了不同类型的随机性,从完全混沌的噪声到具有长程相关性的模式(类似于天气系统在时间上的相关性)。目标是找到哪种计算机模型与真实的DNA序列最匹配。如果一段DNA的表现完全像纯粹的随机性,那么匹配度将会是完美的。如果它显示出特定的、非随机的结构,那么真实DNA与随机模型之间的数学距离就会增加。这种距离或“散度”成为了该部分基因具有多少结构的信号。
结果在所有五种基因中揭示了一个显著且一致的模式。编码蛋白质的DNA部分,即外显子,显示出了强烈且独特的信号。这些编码区域始终偏离随机模型,表明它们拥有特定的、有组织的内部结构。相比之下,非编码部分(称为内含子)占据了基因的大部分长度,其表现更接近于随机、无相关性的模型。这种数学度量有效地突出了基因的“工作”部分与“间隔”部分之间的差异。当研究人员将这些数学剖面与已知的基因生物学图谱进行对比时,信号的峰值与蛋白质编码外显子的位置完美吻合。信号的谷值则对应于内含子。
这一发现表明,信息论方法可以在不需要预先了解生物学功能的情况下,区分编码与非编码DNA。研究还考察了其他调节特征,例如作为基因开关的启动子和增强子。数学信号与这些调节元件之间的联系较不明确且因基因而异,这表明虽然编码结构被该方法稳健地捕捉到了,但调节开关的组织更为复杂且依赖于具体语境。研究人员发现,编码区域的信号强度与基因的大小及其包含的编码DNA量密切相关。
这项研究证明,人类基因的结构组织留下了可检测到的统计特征。通过使用一种衡量序列与纯粹随机性差异的方法,研究人员能够绘制出复杂基因的内部架构。该方法表现得十分稳健,无论是在重叠还是非重叠的部分进行数据分析,都能保持一致。虽然该方法能清晰地分离编码区与非编码区,但其精准定位特定调节开关的能力仍处于发展阶段。这项工作提供了一种观察基因组的新型补充方法,它依赖于序列本身的数学属性,而非仅仅将其与已知的其他序列进行比较。这最终可能帮助科学家更高效地识别基因组中的功能区域,从而为遗传代码如何组织以支持生命提供更深层的理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。