A permutation-null artifact drives a conservation–divergence spectrum's signature trend, and phylogeny dominates a protein language model's per-position coupling signal
本文表明,保守性—分歧谱中显著的负向趋势很大程度上是其置换零模型的产物,且蛋白质语言模型的逐位置耦合信号主要由系统发育而非功能机制驱动,从而为针对独立进化证据对黑盒模型进行严谨的交叉检验建立了一个框架。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
蛋白质是维持生命运转的分子机器,其形状和功能由其构建模块(即氨基酸)的精确顺序所决定。几十年来,科学家们一直试图读取这些序列,以寻找决定蛋白质独特功能的特定位点。两种截然不同的方法在解决这一难题时脱颖而出。第一种方法依赖于比较数千个相关的蛋白质,以观察哪些位点在进化过程中保持不变或共同变化;这种方法透明且易于理解,但它只能识别以单个字母形式呈现的模式。第二种方法使用在数百万个序列上训练的人工智能模型来预测蛋白质的行为;这些模型极其强大,能够感知复杂的隐藏模式,但它们常被称为“黑盒”,因为没有人完全确定它们究竟学到了什么,或者它们是否仅仅是在记忆家族树,而非理解机器的工作原理。该领域面临的问题是,这些智能模型是在发现新的生物学真相,还是仅仅在利用进化史中的捷径。
独立研究员华章沈(Huazhang Shen)的一项近期研究将这两种方法面对面地进行测试,以确切了解它们的认知水平。研究人员将重点放在一类被称为G蛋白偶联受体的特定蛋白质上,这类受体充当细胞表面的开关,决定在被激活时发送哪种内部信号。研究的目标是识别出这些蛋白质中决定其选择何种信号的精确位点。该研究将传统的进化方法和人工智能模型视为两个观察同一组蛋白质的独立观察者。一个观察者寻找区分不同信号类型的特定氨基酸变化,而另一个则使用神经网络根据蛋白质序列来猜测信号类型。随后,研究人员将两个观察者生成的关键位点列表进行对比,以观察它们是否达成一致。
对比结果显示出令人惊讶的意见分歧。两种方法指向的重点位点几乎完全不同,它们的排名几乎没有重叠。这种分歧表明,这两个观察者是通过完全不同的视角来审视问题的。为了理解原因,研究人员首先检查了传统的进化方法。该方法此前显示出一个清晰的模式:在进化过程中高度保守的位点往往在不同信号类型之间表现出较低的变异性。虽然这看起来像是一条生物学定律,但研究发现,这种模式在很大程度上是由测试本身的数学特性所制造的幻象。通过对数据进行随机打乱以建立统计基准,研究人员展示了即使在随机噪声中,这种负相关趋势也会出现。真正的生物学信号并非该趋势本身,而是在减去这一数学基准后所剩余的微小额外变异量。这一发现意味着,许多此前声称基于该趋势发现特异性的研究,可能测量的是统计伪影,而非生物学规则。
随后,调查转向人工智能模型,以探究它究竟学到了什么。当模型在没有任何限制的情况下接受测试时,它似乎非常了解蛋白质会选择哪种信号。然而,当研究人员迫使模型证明其理解的是机制而非仅仅是识别进化近亲时,结果发生了剧烈变化。通过在测试期间将相关的蛋白质进行分组,从而使模型无法依赖家族相似性,模型的性能显著下降。研究计算出,模型表现出的约四分之三的知识仅仅是进化相关性的反映,而非蛋白质工作机制的实际理解。只有约四分之一的信号代表了真正的功能性洞察。这为以下批评提供了强有力的定量证据:即这些强大的模型通常只是识别同源性的捷径,而非对生物学功能的真实理解。
尽管存在这些局限性,研究发现人工智能模型在某一特定领域具有优势。当两种方法产生分歧时,模型的预测更有可能与已知3D结构的蛋白质实际接触其内部伴侣的物理位置相一致。然而,这种一致性很弱,表现为数据的整体偏移,而非一份完美的正确答案清单。为了确保方法运行正确,研究人员还在另一类生物学代码过于复杂、以至于任何方法都难以读取的蛋白质家族上对其进行了测试。在这种情况下,两种方法都未能找到正确的位点且彼此产生分歧,这证实了该框架能够区分真实的生物学极限与工具本身的失效。
研究结论提出了一种测试这些“黑盒”模型究竟掌握了什么的全新框架。它表明,在信任模型的预测之前,科学家必须剥离进化历史的影响,并剔除那些可能模拟真实模式的统计基准。虽然人工智能模型确实捕捉到了一些真实的函数信息,但它受到了家族历史的严重污染,而传统的进化方法则容易将统计噪声误解为生物学定律。这项研究并未宣布哪种方法胜出,而是提供了一种严谨的交叉检验方法,以确保未来的蛋白质功能发现是基于真实的生物学信号,而非数学幻象或进化捷径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。