The standard genetic code's rank among randomized alternatives is not a property of the code
本文表明,标准遗传密码所表现出的所谓特殊性并非其内在属性,而是一种统计伪影,因为其在随机替代方案中的排名会随着特定的突变谱和用于比较的统计量摘要的不同而发生显著波动。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
生命取决于一套用四种字母组成的语言编写的指令。在每个活细胞中,被称为“密码子”的三字母组合充当着“单词”,告诉细胞应该组装哪些构建模块来合成蛋白质。虽然存在六十四种可能的三字母组合,但它们只需要指定二十种不同的构建模块,外加一些停止信号。自然界为此使用了一种特定的排列方式,即所谓的标准遗传密码,其中大多数组合都指向相同的构建模块。几十年来,科学家们一直在思考这种排列是否具有特殊性。他们怀疑这种设计是为了实现鲁棒性(稳健性):如果一次突变改变了一个单词中的一个字母,新单词通常会指向一个与原构建模块性质非常相似的模块。这能最大限度地减少错误对最终蛋白质造成的损害。
为了测试这一观点,研究人员传统上会将标准密码与数千种随机排列进行比较。他们追问:如果我们随机打乱这些单词,标准密码在最小化损害方面的表现能在多大程度上优于其他方案?三十五年来,答案一直以一个单一且令人印象深刻的数字呈现。在一个假设所有变化概率均等的简单模型下,研究发现标准密码比 9,998 个随机替代方案都要好。当科学家加入一个更现实的细节——即某些类型的字母变化发生得比其他类型更频繁时——标准密码看起来显得更加卓越,似乎优于几乎所有的随机替代方案。这导致人们相信,该密码是一个近乎完美的解决方案,并被进化过程冻结在了时间中。
然而,由独立研究人员卢卡斯·乔瓦尼·里贝罗(Lucas Giovani Ribeiro)和马科斯·安德烈·西蒙西尼(Marcos André Simonssini)开展的一项新研究表明,这个单一的数字只揭示了故事的一部分。他们认为,遗传密码的“卓越”地位并非代码本身的固定属性,而是由于我们衡量它的背景在不断变化。研究人员从过去几十年的理论模型中大幅后退了一步。他们不再假设突变是以单一、均匀的方式发生的,而是观察了近 5,000 种不同真核生物(包括动物、植物、真菌和藻类)中实际存在的突变模式。这些谱系各自拥有独特的“突变频谱”,这意味着它们 DNA 中发生的特定错误类型差异很大。
团队计算了标准遗传密码针对每种物种特有的突变模式在抵御错误方面的表现。对于每一个物种,他们都使用该物种特有的突变模式作为测试,并将标准密码与同一组冻结的 10,000 个随机密码进行对比。结果不是一个单一的数字,而是一个广泛的分布。对于大约 22% 的物种而言,标准密码实际上是最好的排列方式;没有任何随机替代方案能超越它。但在其他物种中,有数百个随机密码的表现甚至优于标准密码。在最极端的情况下,10,000 个随机密码中有 341 个的表现超过了标准密码。中位数结果为 2,这与三十五年前那个著名的数字相吻合,但研究人员指出,这个数字只是跨越两个数量级的分布中的一个点。
这项研究揭示了我们在解释这些结果时的一个惊人转折。随着一个物种的突变模式变得更加偏向于某种特定的常见错误,标准密码在绝对意义上对减少损害的效果实际上变得更好。然而,与此同时,随机密码的表现也变得更加多样化。由于随机密码的表现分布变得极其广泛,标准密码看起来就不再那么独特了。这就像一名跑步者变得更快了,但比赛本身变得如此混乱,以至于他不再是那个显眼的佼佼者。研究人员发现,随着突变偏差的增加,标准密码的绝对优势在增长,但它在替代方案中的排名却在下降。这意味着,一个具有高突变偏差的谱系实际上受到该密码更好的保护,但与随机替代方案的混乱情况相比,该密码看起来却没那么“特别”了。
该论文还挑战了两个科学家曾希望证实的特定观点。首先,他们测试了被称为 CpG 位点的特定超突变 DNA 序列是否是这些差异的主要驱动力。他们发现事实并非如此;一旦考虑了普遍的突变偏差,这种特定的序列并没有增加额外的保护能力。其次,他们进行了模拟实验,以观察如果遗传密码是针对高突变偏差进行优化,是否会自然产生类似于标准密码的形式。模拟显示结果恰恰相反:针对强突变偏差进行优化的密码并没有收敛于标准密码,反而变得与标准密码的相似度降低了。这排除了这样一种观点,即标准密码的结构仅仅是由于其针对最常见突变类型进行了优化。
研究人员还观察了当突变产生“停止”信号(即提前结束蛋白质合成过程)时会发生什么。他们发现,虽然在简单的可能性计数中,标准密码在防止此类错误方面表现出色,但如果根据这些错误在真实物种中实际发生的频率进行加权,它的表现就不那么显著了。这种简单的计数与加权现实之间的分歧出现在系统的多个部分,这表明衡量密码质量的方式会改变我们得到的结果。
最终,这项工作并不是说遗传密码不特别。它说的是,其特殊性完全取决于衡量它的语境。标准密码是鲁棒的,但它在随机替代方案中的排名并不是一个恒定的真理。它会随着所研究生物体的突变模式而变化。定义该领域的那些著名数字并没有错,但它们是不完整的。它们代表了在特定假设下的一个快照。当这些假设被替换为跨越数千个物种的、复杂多变的生命现实时,整个图景变得更加复杂。该密码是一个好的解决方案,但它的地位并非代码本身的固定属性,而是代码与它所面临的特定错误之间的一种关系。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。