Pruning the Search, Not the Signal: Adaptive-Banding Needleman-Wunsch Sequence Alignment via Protein Language Model Confidence
本文介绍了自适应带状 Needleman-Wunsch (AB-NW) 方法,该方法利用蛋白质语言模型的置信度来动态修剪动态规划比对的搜索空间,在实现接近精确的准确度的同时,显著降低了计算复杂度,并实现了对大型且具有挑战性的蛋白质序列的高通量处理。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在生命的宏大图书馆中,构建每一个生命体的指令都由四种字母组成的编码书写而成。这些字母串联成长链,形成了蛋白质——这些分子机器构建了细胞,消化食物,并对抗疾病。为了理解一种新蛋白质的功能,科学家经常将其字母序列与已知蛋白质进行比较,寻找暗示共同祖先或相似功能的共有模式。这个过程被称为序列比对,就像试图将两个长短略有不同的句子对齐,以观察哪些单词匹配,以及哪些字母被添加或删除了。几十年来,最可靠的方法是检查这两个句子所有可能的对齐方式,这种方法虽然能保证获得完美答案,但当句子非常长时,速度会变得慢到无法接受。
为了提高速度,研究人员长期以来一直使用一种捷径:他们假设两个序列大致相似,并且只检查字母可能匹配的行,忽略其余部分。当序列是近亲时,这种方法效果很好,但当它们是远亲或者其中一个比另一个长得多时,这种方法就会彻底失败。在这些困难的情况下,真实的匹配路径会偏离中心点很远,而这种捷径会完全错过它,从而导致错误的结论。这给科学家们造成了一个令人沮丧的困境:他们必须在一种过于沉重、无法应对现代数据库的缓慢完美方法,与一种快速但经常出错的快捷方法之间做出选择。
由拉合尔工程技术大学的研究人员开发的一种新方法,为走出这一陷阱提供了途径。该团队并没有去猜测匹配发生的位置,而是教会了计算机首先“阅读”蛋白质序列,使用的是一种经过数百万种已知蛋白质训练的人工智能。这种被称为“蛋白质语言模型”的人工智能能够理解每个字母的语境,知道某些字母经常一起出现,因为它们构成了一种特定的形状或功能。研究人员利用这种深刻的理解,绘制了一张关于匹配可能位置的灵活且智能的地图,而不是依赖于一条僵化、预设的路径。
该过程始于将两个蛋白质序列输入人工智能,人工智能将每个字母转化为对其角色具有丰富意义的多维描述。研究人员随后利用这些描述来创建一个关于这两个蛋白质可能如何对齐的粗略、低分辨率草图。这个草图充当了一个向导,向计算机展示哪些区域极有可能匹配,哪些区域存在不确定性。基于这个向导,计算机绘制了一条走廊——一个潜在匹配的安全区域——这条走廊在人工智能充满信心的地方较窄,而在人工智能检测到不确定性(如大型插入或缺失)的地方较宽。这条走廊并非固定宽度;它会呼吸和移动,即使在真实路径偏离中心很远时,也能扩张并紧紧包裹住真实的路径。
一旦绘制出这条自适应走廊,计算机便仅在这些边界内进行详细且完美的比对。由于走廊比整个可能的网格要小得多,计算机可以极其快速地完成这项工作。在涉及极低相似度蛋白质的测试中,传统捷径有一半以上的概率无法找到正确匹配,而这种新方法在几乎所有情况下都找回了完美的对齐。它消除了高达 92% 的不必要计算,使过程比缓慢的完美方法快了近 13 倍,同时保持了相同的准确度。
研究人员在多种具有挑战性的场景下测试了该系统,包括具有巨大长度差异的蛋白质、含有大段缺失片段的序列,以及那些会让简单工具感到困惑的重复模式序列。在每种情况下,自适应走廊都成功追踪到了真实路径,而固定的捷径要么切断了路径,要么迫使计算机检查整个网格,从而失去了速度优势。该方法在不同的 AI 模型中都表现出了稳健性,证明了利用深度理解来引导搜索这一原则是成立的。通过基于智能而非固定规则来修剪搜索空间,该团队使得在处理现代生物学所需的庞大数据集时,能够进行精确、高质量的比对,而不必牺牲理解生命机制所需的精度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。