← 最新论文
🧬 biology

Transferable Implicit Solvent Machine Learning Potential for Drugs and Proteins Approaching Ab Initio Accuracy

本文介绍了 TWIN,这是一种仅通过从头算(*ab initio*)和实验数据中训练得到的具有可迁移性的机器学习势能,它在隐式水环境下实现了接近密度泛函理论(DFT)的精度,用于药物和蛋白质建模,同时提供了比显式溶剂方法快两个数量级的加速。

原作者: Jan Eckwert, Julija Zavadlav

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jan Eckwert, Julija Zavadlav

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在试图模拟一个蛋白质(一种微小的、扭转着的生物机器)在水池中与一个药物分子共舞的过程。为了准确地做到这一点,你通常必须对每一个水分子进行建模。这就像是在试图统计暴雨中的每一滴雨水,同时还要追踪风中飘动的每一片叶子。这极其精确,但由于它消耗了太多的计算能力,你的电脑在观察完几秒钟的舞蹈之前就会崩溃。

欢迎来到 TWIN(可迁移水隐式网络)。把 TWIN 想象成一个神奇的“隐形水池”。与其去数每一滴水,TWIN 学习的是水的“感觉”——那种推力、拉力和挤压力——而不需要实际画出每一滴水滴。这就像是即便看不见人群中的每一个人,也能准确知道人群会如何绕过一位名人。

重大突破:速度与精度的邂own

这里的主要发现是,TWIN 模拟这些蛋白质-药物之舞的速度比那些数每一滴水的旧方法快了 100 倍(两个数量级),同时其精度仍能与超精确的“从头算”(ab initio)方法相媲美。

通常情况下,科学家们必须在速度或精度之间做出选择。

  • 旧的快速方法: 使用“粗粒化”模型。想象从直升机俯瞰森林;你能看到树木的轮廓,却会错过叶子。这些模型很快,但往往会出错,因为它们是基于“不完美”的数据(如旧的、简化的力场)训练出来的。
  • 旧的精确方法: 使用“显式溶剂”模型。这就像是在地面上数每一片叶子。它很精确,但非常耗时。

TWIN 反驳了这种观点,即认为训练快速模型必须依赖于那些旧的、简化的“力场”数据。论文表明,如果你的模型是基于高水平量子物理数据(DFT)和现实世界的实验数值进行训练的,你就能获得“直升机视角”的速度,同时拥有“数叶子”般的精度。

他们是如何打造这个神奇机器的

作者并没有仅仅靠猜测;他们通过三个特定的阶段构建了 TWIN,就像在电子游戏中升级一样:

  1. 第一级:原子级导师 (TWIN-AT)。 首先,他们利用包含 166 万个化学构型的庞大数据集,并结合高水平量子物理数据(来自 SPICE 数据集)训练了一个模型。这个名为 TWIN-AT 的模型学习了原子在水存在时的相互作用方式,实现的力误差仅为 24.6 meV/Å。这就像是一个完美背诵了物理教科书的学生。
  2. 第二级:蛋白质健身房 (TWIN-FM)。 接下来,他们需要教会这个模型如何处理大型蛋白质。他们无法用超精确的量子方法来模拟大型蛋白质(那将需要对每个蛋白质花费 17 年 的时间!),因此他们使用了一个聪明的技巧。他们在 41 个不同的蛋白质结构域(总计 410 万 个构型)上运行了标准且较快的模拟,并使用第一级模型来为受力进行“评分”。这教会了 TWIN 如何在不需要为每一步都进行超慢速量子数学运算的情况下,处理大型、具有柔性的蛋白质。
  3. 第三级:现实检验。 最后,他们使用现实世界的实验数据对模型进行了微调。他们观察了 1,148 个类药物分子,并调整模型,直到其对“水合自由能”(溶解一个分子所需的能量)的预测与真实实验相匹配。结果是,误差仅为 0.76 kcal/mol,这与实验的不确定度 0.6 kcal/mol 非常接近。

它真的有效吗?

作者在 TWIN 从未见过的物体上对其进行了测试,以观察其泛化能力。

  • 药物分子: 他们测试了一种用于治疗多发性硬化症的药物 ozanimod。TWIN 预测该分子在水中扭转和转动的方式,与超精确参考值的误差仅为 0.293 kcal/mol。它正确捕捉到了能量景观的“形状”,而旧模型往往会将能垒预测错超过 2 kcal/mol
  • 多肽: 对于一种被称为 Ala3 的微小蛋白质链,TWIN 正确预测了它在水中更倾向于特定的形状(称为 pPII),这与实验观察一致。旧模型经常出错,认为该链条要么太硬,要么太软。
  • 大型蛋白质: 他们测试了四个真实的蛋白质:Ubiquitin, GB1, CspA, 和 IFABP。TWIN 使这些蛋白质保持折叠和稳定状态,符合关于其各部分灵活性的实验数据。虽然它预测蛋白质比一些旧模型稍微更“爱动”,但它比那些会让蛋白质解体的其他“快速”模型要稳定得多。

TWIN 还不是什么(目前而言)

了解论文中提到的 TWIN 不能做的事情很重要。

  • 它不能从头开始解决蛋白质折叠问题。 论文明确指出,TWIN 是在已经折叠的蛋白质上进行测试的。它并不是设计用来观察一个蛋白质如何从一段随机的氨基酸序列折叠成特定形状的;那需要不同的工具。
  • 它并非对所有情况都完美。 论文指出 TWIN 是基于“局部”视角(它观察 0.5 nm 以内的邻居)。这意味着它可能会错过在更长距离内发生的某些长程“幽灵”相互作用,这也是为什么它有时会预测蛋白质比最刚性的实验数据表现得更“爱动”。
  • 它不是所有溶剂的万能药。 这个特定的模型是针对进行训练的。作者建议该方法可以适用于其他液体,但本篇论文仅证明了其在水中的有效性。

总结

TWIN 表明,我们终于可以模拟水中复杂的生物系统,并达到近乎完美的精度,而无需等待几个世纪让计算机完成任务。它之所以能实现这一点,是通过直接学习最好的物理数据和实验数据,跳过了那些阻碍该领域发展的“不完美”中间人模型。

虽然论文显示 TWIN 在特定基准测试(如 0.76 kcal/mol 的溶剂化能误差)上表现出了极高的准确性,但它将此定位为效率和精度方面的重大进步,为以前无法实现的模拟铺平了道路。这不仅仅是一个微小的改进;这是一种观察水中生命之舞的新方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →