← 最新论文
🤖 machine learning

Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs

本文介绍了 AP-REASONER,这是一个基于因子图的优化框架,它将多序列比对(MSA)子采样视为一个可控问题,从而能够显式地平衡查询标识度(query identity)与多样性等进化信号,进而通过在蛋白质结构预测和构象系综恢复方面的表现,超越了启发式方法。

原作者: Zhangzhi Xiong, Minzhang Li, Haotian Yu, Sixian Shen, Kexin Zhang, Mingrui Li, Jie Zheng, Kewei Tu, Jingyi Yu

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhangzhi Xiong, Minzhang Li, Haotian Yu, Sixian Shen, Kexin Zhang, Mingrui Li, Jie Zheng, Kewei Tu, Jingyi Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,生命的语言是用一种被称为蛋白质的代码编写的。这些不仅仅是静态的区块;它们是微小的、具有折叠能力的机器,承担着从构建你的肌肉到对抗病毒的一切功能。为了理解一个蛋白质是如何工作的,科学家们经常观察它的“家族树”——一个被称为多序列比对(MSA)的海量相关序列集合。把这个家族树想象成一座巨大的、充满噪音的图书馆,其中的每一本书都是同一个故事略有不同的版本,由生活在数百万年前的祖先所书写。通过同时阅读这些书,计算机可以推断出蛋白质的三维形状以及它是如何运动的。

然而,这里有一个问题:这座图书馆太大了。现代超级智能的计算机程序(被称为蛋白质语言模型)就像是那些一次只能阅读几百页就会感到大脑过载的天才学生。如果它们试图阅读整座图书馆,就会崩溃。因此,科学家们必须挑选出一小部分具有代表性的书籍来进行研究。长期以来,他们一直通过猜测来进行这项工作——随机挑选书籍,或者试图寻找差异最大的书籍,亦或是过滤掉重复项。这有点像是在试图为派对挑选 100 首最好的歌曲,却只是从顶层堆里随手抓取一 handful,或者只挑选那些你以前听过的歌。这种方法效果尚可,但你可能会错过那些解释蛋白质如何起舞的隐藏瑰宝。

这篇论文介绍了一种挑选这些“歌曲”的新方法,叫做 AP-REASONER。与其仅仅依靠猜测或简单的过滤,作者们将选择过程视为一个需要用数学来解决的复杂谜题。他们构建了一个像是一个智能委员会会议一样的系统。想象一个充满了蛋白质序列的房间,目标是选出特定数量的序列来代表整个群体。该系统使用一个“因子图”(factor graph),它就像一个巨大的连接网络,通过逻辑推理来进行选择。它会提出这样的问题:“如果我选择了这个序列,它是否覆盖了足够广泛的范围?”以及“这个序列看起来是否与我们已经选出的那个太相似了?”

这种新方法的魔力在于它有两个可以用来改变结果的“控制旋钮”。一个被称为 α\alpha 的旋钮,控制着选出的群体应该有多么多样化。调高它,系统就会挑选彼此之间差异极大的序列,从而确保讲述了多样化的进化故事。另一个旋钮 β\beta,则控制着选定序列与原始“查询”蛋白质之间的接近程度。调高这个旋钮,系统就会专注于寻找与目标非常相似的序列,这有助于发现蛋白质可能采取的特定形状或状态。

研究人员将这个新的“推理”系统与旧的猜测方法进行了对比测试。他们发现,当使用 AP-REASONER 时,计算机模型能够更好地预测蛋白质如何折叠,更令人印象深刻的是,它们能更好地预测蛋白质如何改变形状。在某些测试中,旧的方法完全错过了某些形状,而新方法却能轻松找到。例如,对于一种名为 KaiB 的蛋白质,新方法能以比旧方法少得多的尝试次数,找到一种罕见的、隐藏的形状;而旧方法则必须进行疯狂的猜测并浪费大量的计算资源。这篇论文表明,通过将蛋白质序列的选择视为一个精细且可控的优化问题,而非随机猜测,我们可以更清晰地观察生命的基本构建块是如何运动和运作的。这不仅仅是挑选几本书的问题;这是关于如何策划出一个完美的剧本,以理解一个角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →