← 最新论文
💻 computer science

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

本文介绍了 DynaPPI,这是一个大规模分子动力学轨迹数据集,旨在捕捉蛋白质复合物的动态形成过程,从而使扩散模型能够学习结合过程并准确预测未知多链蛋白质聚集体的结构。

原作者: Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人体就像一座繁忙的城市,由被称为蛋白质的微小、肉眼看不见的乐高积木组成。其中一些积木可以独立工作,但大多数则像是专门的团队,必须拼凑在一起才能制造机器、发送信号或抵御入侵者。几十年来,科学家们非常擅长在这些团队已经构建完成并紧紧锁在一起后为它们拍照。这就像是拥有了一张成品乐高城堡的照片,却不知道这些零件是如何在空中飞行、碰撞并最终卡入位的。这是一个大问题,因为“如何做”与“是什么”同样重要。如果你想设计一种新药来阻止病毒,你需要知道病毒的蛋白质是如何寻找其目标的,而不仅仅是了解它们结合在一起时的样子。

最近,计算机在利用一种被称为“扩散模型”的人工智能技术来预测这些蛋白质团队的形态方面变得非常出色。你可以把这些模型想象成一位神奇的艺术家,她能将一张模糊、混乱的草图变成一张清晰、完美的图像。但问题在于,这些艺术家的训练素材仅限于静态快照或单独移动的积木。她们不知道如何描绘两支独立的队伍奔向彼此、翩翩起舞并最终拥抱成一个复杂机器的过程“电影”。如果没有这部“电影”,人工智能就无法预测新的、未知的团队将如何形成,这在我们的能力中留下了一个巨大的空白,阻碍了我们设计新药或在最基础层面理解生命的能力。

于是,诞生了 DynaPPI——一个旨在教导人工智能如何观察并预测这些“蛋白质舞蹈”的海量新数据集。这项研究背后的研究人员意识到,要修复人工智能的盲点,他们需要创建一个“电影库”,展示蛋白质链从彼此分离到紧密结合的整个过程。他们并没有仅仅观察最后的握手,而是模拟了整个旅程。他们提取了已知的蛋白质团队,将它们拆解开,然后利用强大的计算机模拟来观察它们在时间流逝中漂浮、碰撞并重新组装的过程。

该团队创建了一个包含约 10,000 个此类蛋白质复合物的数据集,涵盖了不同的伙伴关系类型,如蛋白质-蛋白质、蛋白质-配体(蛋白质遇到小型药物分子)以及蛋白质-核酸(蛋白质遇到 DNA 或 RNA)。为了确保模拟的真实性,他们并没有仅仅靠猜测,而是运行了数千次详细的计算机实验。每次实验都会追踪原子在从 10 纳秒到 1 毫秒不等的时间跨度内的运动。虽然这听起来很短,但在原子的世界里,这简直是一个永恒——足以看到它们扭动、旋转并找到彼此。该数据集包含超过 1,000 亿帧数据,捕捉了位置、速度和能量的每一次细微变化。

DynaPPI 的特别之处在于,它明确地教授了 AI “结合”的过程。在过去,AI 模型就像是那些只学习最终考试答案的学生。而现在,有了 DynaPPI,它们可以学习循序渐进的“家庭作业”。该数据集展示了蛋白质在远离时如何表现,在靠近时如何改变形状,以及在锁定之前“中间状态”看起来是什么样的。研究人员通过采取已知结构、分离链条,然后将它们释放到虚拟的水和盐溶液中,以观察它们是否能再次找到彼此,从而模拟了这些事件。他们多次运行了这些模拟(副本),以确保捕捉到自然界的随机性,就像多次掷骰子以观察所有可能的结果一样。

论文指出,通过将这种动态数据输入扩散模型,人工智能不仅可以学习预测蛋白质复合物的最终形状,还可以学习它到达那里的整个路径。这可能会成为药物设计的游戏规则改变者。想象一下,能够模拟一个新的药物分子如何搜寻致病蛋白质,并发现那些仅在“舞蹈”过程中才会开启的临时口袋,而不仅仅是盯着一扇关闭的门。作者提出,这可以帮助科学家设计更好的药物、工程化新的生物机器,甚至通过理解病毒如何与人类细胞相互作用来应对未来的大流行病。

然而,需要注意的是,这目前是一个提议和资源的构建过程,而非一个已经解决了所有谜团的成熟产品。论文概述了一个构建该数据集的计划,描述了他们将如何选择蛋白质、清理数据并运行模拟。他们设定了具体目标,例如确保数据覆盖广泛的蛋白质类型,以及确保模拟的准确性足以匹配现实世界的实验。他们也承认,虽然我们可以模拟这些过程,但真正的考验将是其他科学家使用这些数据来训练他们自己的 AI 模型,并观察这些模型是否能成功预测从未见过的结构。该数据集旨在保持开放和可访问,允许全球科学界在此基础上进行构建,并推向人工智能在生物学领域能力的边界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →