Ancestral Sequences Cannot be Accurately Reconstructed via Interpolation in a Variational Autoencoder's Latent Space
本研究表明,尽管变分自编码器具有建模上位效应相互作用的潜力,但其解码过程中固有的信息丢失使其无法准确重建祖先序列,因为它们始终被标准的基于似然法和简约法的方法所超越。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在生命的漫长历史中,每一个生物都携带其祖先的分子记录。科学家们长期以来一直试图解读这一记录,这一过程被称为祖先序列重建。想象一下,你正试图根据许多曾孙辈所持有的副本,去推测曾祖辈写下的一封信中确切的字句。在生物学中,这些“字母”就是构成蛋白质的氨基酸链,而蛋白质是每个细胞中的劳模。几十年来,研究人员一直使用统计模型来填补缺失的词汇,并假设链中的每个字母都独立于其他字母发生变化,就像句子中的单个单词被替换而不会影响整体含义一样。这种方法一直是理解蛋白质在数百万年间如何进化的标准工具。
然而,生物学很少如此简单。在现实中,蛋白质链中的字母往往相互依赖;改变一个氨基酸可能只有在附近的另一个特定变化同时发生时才是安全的。这种复杂的相互依赖关系被称为上位性(epistasis),很难用传统的统计工具来捕捉。最近,新一代人工智能工具,特别是被称为变分自编码器(variational autoencoder)的一种深度学习模型,提供了一条不同的路径。这些模型擅长在海量数据中寻找隐藏的模式。它们可以将一段长的蛋白质序列压缩成一个紧凑的数学摘要,即“嵌入”(embedding),然后尝试从该摘要中重建原始序列。由于这些模型直接从数据中学习,而无需被告知忽略字母之间的联系,许多科学家曾希望它们能够解决上位性问题,并以空前的准确度重建古老的蛋白质。
一个研究小组着手直接测试这一希望。他们构建了一个利用这些 AI 模型来猜测古代蛋白质序列的流程。其思路非常直接:将我们今天拥有的现代蛋白质压缩成这些数学摘要,然后利用已知的蛋白质家族树对这些摘要进行插值,即推测古代祖先的摘要看起来是什么样的。一旦他们得到了这些推测出的摘要,就会将它们反馈给 AI 以生成实际的氨基酸序列。如果这能奏效,就意味着深度学习可以绕过传统统计学的局限性,揭示蛋白质真实的进化史,即使这些历史是由分子不同部分之间的复杂相互作用所塑造的。
研究人员通过计算机模拟对这个想法进行了测试。他们创建了数千个虚构的蛋白质家族,这些家族随时间演化,最初是使用传统模型所假设的简单、独立的规则,然后是使用包含自然界中那种相互依赖变化的复杂规则。随后,他们尝试使用这种新的 AI 方法和既有的统计方法来重建这些虚构家族的祖先。结果清晰且一致。在每种情况下,无论蛋白质进化得简单还是具有复杂的依赖性,传统的统计方法都优于 AI 方法。深度学习模型未能产生准确的祖先序列,甚至在它理应大放异彩的情况下也是如此。
研究深入探讨了 AI 失败的原因。事实证明,问题并不在于 AI 忽略了家族树结构。当研究人员观察这些数学摘要时,他们发现 AI 确实学会了以反映其进化关系的方式来组织蛋白质。失败在于重建步骤本身。AI 模型在努力将数据压缩成微小摘要的过程中,不可避免地丢失了一些原始序列的精细细节。当研究人员试图从这些摘要重建古代蛋白质时,信息变得过于模糊。模型无法生成具有足够精确度的序列来匹配真实的进化史。即使研究人员增加了数学摘要的大小以试图保留更多信息,收益也非常微小,而且模型开始仅仅是死记硬背现代蛋白质,而不是学习进化的普遍规律。
研究人员还测试了一种更先进的 AI 版本,该版本在训练过程中被明确教授了家族树。他们曾希望这种额外的指导会有所帮助,但并未改善结果。根本性的瓶颈仍然存在:将序列压缩成摘要然后再将其展开的过程对于猜测过去这一精细任务来说,信息损失过于严重。研究结论指出,虽然这些 AI 嵌入是可视化蛋白质家族和预测现代蛋白质行为的强大工具,但它们尚未准备好取代成熟的统计方法来进行过去史的重建。希望深度学习能够毫不费力地解决复杂进化相互作用问题的想法,在这一特定应用领域,是一个死胡同。传统的统计方法尽管有着更简单的假设,但仍然是解读生命分子历史更可靠的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。