Seq2DomML: Protein Domain Boundary Prediction from Bacterial Protein Sequences Using a Machine Learning Framework
Seq2DomML 是一种新型基于序列的机器学习框架,该框架利用基于理化和进化特征训练的双向 LSTM 模型,在不需要结构坐标或同源结构域分配的情况下,准确预测细菌蛋白质的结构域边界,其性能优于现有的注释工具。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
蛋白质是生命的劳模,它们是微小的分子机器,通过折叠成复杂的形状来执行细胞内的每一项功能。为了了解蛋白质是如何工作的,科学家通常需要极其详细地研究其形状,而这一过程通常需要将蛋白质分离并结晶。然而,许多蛋白质由于过长或过于松散,无法作为一个整体进行研究。它们通常由几个不同的、稳定的单元(称为结构域)组成,并由灵活的、无结构的区域连接,这些区域起到了铰链或间隔器的作用。为了获得单个结构域的清晰图像,研究人员必须在正确的位置对蛋白质进行切割,在保持稳定部分完整的同时去除那些松散的部分。寻找这些切割点非常困难,因为切割位置的指令隐藏在蛋白质的氨基酸序列中,而在没有已知三维结构的情况下,这就像是在从未见过纸飞机展开后的情况下,试图寻找折叠纸飞机的接缝。
几十年来,科学家一直依赖于将蛋白质序列与已知且经过深入研究的蛋白质库进行对比的数据库,以此来推测这些结构域可能出现的位置。这种方法在蛋白质与库中已知蛋白质相似时效果良好,但对于没有已知亲缘关系的全新或异常蛋白质,这种方法会完全失效。威尔弗里德·劳里尔大学的一组研究人员开发了一种名为 Seq2DomML 的新工具,绕过了这一限制。该系统不再寻找与已知蛋白质库的匹配项,而是学习识别序列中指示稳定结构域与柔性连接器之间边界的细微化学和物理模式。通过在数千个已知结构的细菌蛋白质上训练计算机模型,研究人员创建了一个系统,仅根据氨基酸序列即可预测在哪里切割蛋白质,即使该蛋白质从未被见过。
研究人员首先收集了一个大规模的细菌蛋白质数据集,这些蛋白质是通过 X 射线晶体学技术(一种可以揭示原子精确三维排列的技术)解析的。他们过滤了这份名单,剔除了彼此过于相似或属于行为方式不同的特定类群的蛋白质,最终保留了近 7,600 条独特的蛋白质链。对于每一条链,他们使用了一个可靠的结构数据库,将每一个氨基酸标记为属于稳定结构域还是属于柔性区域(如连接器或尾部)。为了让计算机更容易学习这些边界,他们稍微扩大了柔性区域的标记范围,将其视为短段而非单个点。
接下来,团队将氨基酸的原始序列转化为每个位置的丰富数值描述。他们包含了关于每个氨基酸的化学性质、其在链中的位置以及它如何与其邻居相互作用的信息。这为每个氨基酸生成了近 2,400 种不同的特征。为了管理这种复杂性,研究人员采用了两步法来筛选最有用的特征。首先,他们删除了冗余或无关的特征。然后,他们采用了一种进化算法(一种模仿自然选择的方法),通过测试成千上万种不同的特征组合,以找到能让计算机做出最准确预测的特定特征集。
该系统的核心是一种被称为双向长短期记忆(bidirectional long short-term memory)模型的类型人工智能。这种模型旨在处理序列,使其能够理解特定氨基酸的身份不仅取决于其直接相邻的邻居,还取决于整个链的更广泛背景。该模型经过训练,用于预测每个氨基酸属于稳定结构域还是柔性区域。为了处理柔性区域远少于稳定区域这一事实,研究人员调整了训练过程,使其特别关注这些难以发现的边界。经过广泛的测试和调优,他们确定了一个既能平衡寻找所有柔性区域的需求,又不会错误地将稳定部分标记为柔性的配置。
当团队将这个新工具应用于一组从未见过的蛋白质时,结果令人鼓舞。该模型成功识别了结构域边界,具有很高的准确度,性能优于几种依赖于将序列与已知家族进行对比的现有成熟工具。虽然旧工具在寻找每一个可能的柔性区域方面表现更好,但它们经常出错,会将稳定的、折叠的部分标记为柔性,如果科学家尝试在那里切割蛋白质,会导致实验结果不佳。相比之下,Seq2DomML 更加严谨,能以更高的精度正确识别稳定结构域和柔性连接器。这意味着当科学家使用此工具决定在哪里切割蛋白质时,不太可能意外破坏功能单元。
研究人员还将他们的预测结果映射到实际的三维蛋白质结构上进行了可视化展示。在其他工具因缺乏已知亲缘关系而无法识别某个结构域的情况下,Seq2DomML 正确识别出了稳定的折叠区域。在一个例子中,现有工具将蛋白质的大部分视为无结构且无用的部分,而新模型则正确地将其识别为一个独特的、稳定的结构域。这表明该工具可以在其他方法视为随机或无结构的序列中发现规律。该模型并不总是能完美地确定结构域的数量,但与当前的标准方法相比,它提供了一个更平衡、更可靠的切割指南。
研究结论指出,这种基于序列的方法为设计蛋白质实验提供了一种极具价值的新途径,特别是对于那些理解不足或缺乏已知亲缘关系的蛋白质。通过提供一份关于稳定结构域何时结束以及柔性区域何时开始的更准确的地图,该工具可以通过减少寻找正确蛋白质片段所需的失败实验次数,从而帮助科学家节省时间和资源。研究人员指出,虽然该模型是一个重要的进步,但未来的工作将集中在提高其检测边界的能力,并测试其是否在细菌以外的其他生物蛋白质上也同样有效。最终目标是使求解蛋白质结构的过程更加高效,从而在蓝图缺失的情况下,也能让科学家理解生命的机制。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。