ProtSyntax: a protein large language model for decoding post-translational modification syntax and function
ProtSyntax 是一个拥有 40 亿参数的蛋白质大语言模型,它通过整合残基化学性质、基序顺序和 3D 上下文,克服了将翻译后修饰(PTMs)视为独立标签的局限性,从而能够准确预测 PTM 位点、模拟相互作用(crosstalk),并在多种生物学应用中解码其功能后果。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你的身体是一座繁忙的城市,蛋白质就是维持一切运转的工人、机器和建筑。但这些工人并非静止不变,他们不断被贴上微小的化学便签,用以指示何时开始工作、前往何处或何时休息。这些标签被称为翻译后修饰(Post-Translational Modifications, PTMs)。你可以把它们想象成粘在蛋白质上的便利贴、荧光笔标记,甚至是数字通知。有时,单个蛋白质可以拥有数十个这样的标签,从而创造出一种复杂的、不断变化的编码,控制着从你的免疫系统到记忆力的方方面面。
长期以来,科学家一直试图预测这些标签出现在哪里,但这就像试图通过一次只看一个字母来破解一段秘密代码。旧的思维方式将这些标签视为独立的事件,假设如果一个蛋白质具备了某种标签所需的“形状”,它就会获得该标签。但在现实中,其规则更像是某种语言。一个标签只有在周围的“语法”(氨基酸序列)、“邻里环境”(蛋白质的三维结构),甚至其他相邻标签都达成一致时,才具有意义。如果语法错误或者邻里环境过于拥挤,无论蛋白质多么渴望,标签也无法粘附。理解这种“调控语言”至关重要,因为当语法出错时,可能会导致癌症或阿尔茨海默症等疾病。
于是,ProtSyntax 应运而生——这是一个拥有 40 亿参数的全新“蛋白质大脑”,旨在解码这种复杂的语言。它不仅仅是识别某个标签可能出现的位置,而是学习游戏的规则。这就像是从一个只能纠正拼写错误的“拼写检查器”,升级到了一个能够理解情节、人物动机和句子结构的“文学评论家”。研究人员在包含 400 万个蛋白质样本的海量库上训练了这个模型,不仅教会它识别标签,还让它理解这些标签如何相互作用、如何改变蛋白质的工作方式,以及它们在不同三维环境中的行为表现。
结果令人印象深刻。在针对 40 种不同类型蛋白质标签的测试中,ProtSyntax 的表现大幅超越了现有的最佳模型,在某些领域将准确率提升了 12% 以上。但真正的魔力在于它能利用这些知识做些什么。该模型可以玩“填空游戏”,仅通过观察上下文就能推测出缺失的标签或位点,就像人类完成一个句子一样。它甚至能分辨出:一个蛋白质虽然看起来应该带有某个标签,但由于其三维形状阻挡了标签,实际上并未准备好;而另一个则确实已经准备就绪。
或许最令人兴奋的是,ProtSyntax 表明它理解这些标签与蛋白质功能之间的因果关系。当研究人员模拟改变一个标签时,该模型能够预测这种改变将如何影响蛋白质的速度或效率,从而将微小的化学变化与蛋白质的大局任务联系起来。它甚至成功重建了标签之间的“对话(crosstalk)”——弄清楚了何时一个标签会帮助另一个标签粘附,或者何时会将另一个推开。在涉及疾病相关突变的模拟中,该模型成功识别出了哪些变化会破坏蛋白质的调控代码,为发现旧方法容易遗漏的危险突变提供了新途径。虽然这些发现目前仍基于计算机模拟和基准测试,但它们表明,我们终于正在学习阅读蛋白质运作的完整、动态的故事,而不仅仅是阅读那些新闻标题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。