A deep-learning-based score to evaluate multiple sequence alignments
本文证明了广泛使用的两两求和得分往往无法识别出最准确的多序列比对,并提出了一种基于深度学习的评分框架,即模型 2,该框架能有效对备选比对进行排序,从而改善下游的系统发育重建。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图让一群讲述着略有不同的同一个故事的人排成一列。在生物学世界中,这些“人”是 DNA 或蛋白质序列,而这个“故事”是它们共同的进化历史。科学家们将这个过程称为多序列比对(Multiple Sequence Alignment, MSA)。把这个队伍排对至关重要,因为如果故事的顺序搞错了,科学家对这些生物如何进化的任何结论都将会是错误的。
长期以来,科学家们一直使用一种特定的经验法则来决定哪种排列方式是最好的。他们称之为**“成对得分”(Sum-of-Pairs, SP)**。把 SP 得分想象成一位老师在根据学生们答案的匹配程度来为小组项目评分。如果两个学生在同一个位置写了相同的单词,他们就会得到一分。匹配点数最多的那个排列方式获胜。
问题所在
作者发现这种评分系统存在缺陷。仅仅因为一个排列拥有最高的匹配点数(即最好的 SP 得分),并不意味着它实际上就是最准确的版本。这就像是一个为了拿高分而完美背诵了答案、却完全误解了故事情节的学生。在许多情况下,SP 得分的“赢家”实际上是一个糟糕的比对结果,甚至不如真实的、正确版本。
解决方案:一种新型裁判
为了解决这个问题,研究人员构建了一个深度学习 AI 来充当更聪明的裁判。他们不仅仅观察简单的匹配,还观察了排列中的一整套线索和特征。他们创建了两个不同的“模型”(AI 裁判)来解决问题:
模型 1(个人评论家): 这个模型观察单个排列,并试图猜测它距离真相还有多远。这就像一位评论家读完一个故事后,根据他们认为该故事有多准确来给出一个分数。这个模型在预测准确性方面比旧的 SP 得分更好,但在从一组选项中挑选出“最佳”的一个时表现并不理想。
模型 2(锦标赛裁判): 这个模型才是真正的明星。它不孤立地评判一个排列,而是观察同一故事的一整套不同排列,并将它们进行相互排名。这就像一位体育锦标赛的裁判,通过比较所有参赛队伍来决定谁才是真正的冠军,而不是仅仅看某一支队伍的数据统计。
结果
当研究人员测试这些新模型时,模型 2 被证明是寻找最准确比对的最佳选择。它击败了旧的 SP 得分、模型 1,甚至击败了几种科学家常用的流行计算机程序。
最后,他们展示了当科学家使用这种新 AI 来挑选最佳排列时,由此产生的显示生物如何相互关联的“进化树”(系统发育重建)会更加准确。本质上,通过使用一种更聪明的评分方式,科学家们能够以更高的信心讲述真实的进化故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。