Efficient exploration of conformational ensembles via protein interaction-informed deep learning
本文介绍了一种名为 DynoM 的生成式深度学习框架,该框架通过在蛋白质复合物相互作用上进行训练,利用复合物数据中固有的长程物理约束,在预测准确的构象系综以及抑制结构幻觉方面,显著优于现有的仅基于单体的模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
核心图景:预测蛋白质如何“起舞”
请不要把蛋白质想象成一座僵硬的雕像,而要把它想象成一个鲜活、呼吸着的舞者。为了完成它的工作(比如对抗病毒或构建细胞),蛋白质并不仅仅保持一种姿势;它会不断地变换、扭转和流动,经历成千上万种不同的姿态。科学家们将这种姿态的集合称为**“构象系综”(conformational ensemble)**。
理解所有这些姿态对于设计新药至关重要。然而,在现实生活中观察蛋白质的舞蹈是极其缓慢且昂贵的。这就像是用一台每小时只能拍一张照片的相机,试图去拍摄蜂鸟振动翅膀的瞬间。
长期以来,科学家使用**分子动力学(MD)**模拟在计算机上“拍摄”这些舞蹈。但这需要庞大的超级计算机,而且耗时极长。最近,**人工智能(AI)**介入了,能够瞬间预测这些舞蹈。但问题在于:AI 模型经常会把舞步跳错,尤其是在面对复杂的、由多个部分组成的蛋白质时,会导致“幻觉”(即物理上无法实现的虚假姿态)。
发现: “伙伴”效应
由 Zilin Ren 及其同事领导的研究团队发现了一个让 AI 变得更出色的秘密配方:蛋白质伙伴(Protein Partners)。
通常在训练这些 AI 模型时,科学家会给它们看蛋白质独自跳舞(单体)的照片。作者假设,这遗漏了拼图中的关键一块。在现实世界中,蛋白质经常与伙伴一起跳舞(复合物)。当它们与伙伴牵手时,它们会学习到关于自己能伸展多远或能扭转多紧的特定规则。
类比:
想象正在学习跳舞。
- 旧方法: 你观看独舞者的视频。你学会了舞步,但你不知道当有人抓住你的手时该如何反应。
- 新方法 (DynoM): 你观看双人舞的视频。即使你只看了少量的双人舞视频,你也学会了“握手”的物理规则。这教会了你如何与他人共同移动,而这实际上也能帮助你更好地理解如何“独自”移动。
他们做了什么:构建 “DynoM”
团队构建了一个名为 DynoM 的新 AI 模型。以下是他们的训练过程:
- “静态”课程: 他们首先利用蛋白质对(复合物)的静态照片来教导模型。他们发现,即使使用很少的数据(仅为使用单体蛋白质总数据的 10%),也能显著提升模型的智能化程度。它学会了蛋白质之间的“互动规则”。
- “动态”课程: 静态照片是不够的,你需要看到运动。由于关于移动中的蛋白质对的公开数据非常稀缺,团队运行了自己的超级计算机模拟,生成了 5,502 个全新的“电影”(轨迹),展示了蛋白质对如何共同起舞。
- 微调: 他们利用这些新电影来微调模型。这起到了“现实检查”的作用,纠正了模型可能尝试做出的任何古怪、不可能的动作。
结果:一位更好的舞者
当他们将 DynoM 与其他顶尖 AI 模型进行对比测试时,结果令人印象深刻:
- 数据效率: DynoM 使用远少于其竞争对手的数据就达到了更好的效果。其他模型需要庞大的单体蛋白质库,而 DynoM 从规模较小的蛋白质对库中学到了更多知识。
- 不再产生“幻觉”: AI 蛋白质模型的一个大问题是它们有时会发明出不可能的形状,尤其是对于具有多个结构域(比如有两个不同“手臂”的蛋白质)的蛋白质。因为 DynoM 是从蛋白质对中学习的,它理解了这些“手臂”能触及多远的物理极限。它不再制造出不可能的姿态。
- 通用性: 尽管它是基于蛋白质“对”进行训练的,但它在预测蛋白质“独自”移动方面表现得非常出色。它不会“卡”在伙伴的姿势里;它学习到了适用于两种情况的底层物理规律。
总结
论文指出,要教 AI 如何让蛋白质运动,我们不应该只给它们看单人舞者。我们需要让它们看双人舞。与伙伴互动的物理约束提供了知识中的“缺失环节”,帮助 AI 理解蛋白质运动的基本规则。
DynoM 正是这一成果:一个稳健、高效的工具,它利用这些“伙伴课程”来生成准确、符合物理现实的蛋白质舞蹈预测,为研究蛋白质动力学的研究人员提供了一个强大的新工具。
(注:论文提到,虽然 DynoM 在预测蛋白质如何运动方面表现出色,但其预测蛋白质对精确结构的能力仍在改进中,尚未达到完美。)
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。