← 最新论文
🔬 materials science

Universal Machine-learning Molecular Dynamics at the Speed of Empirical Potentials

本文介绍了 DPA4C,这是一种协同设计的等变机器学习势函数,它在多种化学体系中实现了接近第一性原理的精度,同时具备经验势函数的运行速度和可扩展性,使得在单块 GPU 上进行数百万原子规模的分子动力学模拟成为可能。

原作者: Tiancheng Li, Jianming Xue, Linfeng Zhang, Duo Zhang, Han Wang

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Tiancheng Li, Jianming Xue, Linfeng Zhang, Duo Zhang, Han Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

为了理解原子世界,科学家们通常依赖两种截然不同的工具。一种是源自量子力学最深层规律的一套规则,它提供了极高的精度,但对计算能力的要求如此之高,以至于模拟仅限于微小的原子集合或转瞬即逝的时间片段。另一种是一套简化的、经验性的规则,运行速度极快,允许研究人员观察数十亿个原子在长时间内的相互作用,但当化学环境发生变化或需要高精度时,这些规则往往会失效。几十年来,科学界一直面临着一个令人沮丧的选择:你可以拥有高精度的模拟,或者拥有高速度的模拟,但两者很难兼得,更不用说能够处理现实世界材料中那种混乱且复杂的混合物了。

现在,一组研究人员引入了一种新的方法来弥合这一差距。他们开发了一个名为 DPA4C 的系统,它将量子力学的准确性与简单经验规则的速度结合在一起。这一成就使得科学家能够运行大规模系统的模拟,其包含数十亿个原子,并达到此前无法实现的细节水平。这项工作意义重大,因为它使研究复杂过程成为可能,例如不同金属在其边界处如何混合,或者材料在压力下如何反应,且无需牺牲信任结果所需的精度。通过将巧妙的数学设计与高度优化的计算机代码相结合,该团队创建了一个能够处理极其多样化的化学元素,并能在标准图形硬件上运行的工具,而以往这种速度曾是粗略近似模型的专属领域。

这一突破的核心在于计算机如何“思考”原子。在以往尝试利用机器学习模型预测原子行为的过程中,模型通常必须将复杂的学习信息逐层传递给相邻的原子。这个过程就像一场“传声筒”游戏,信息必须经过许多人之手才能传递,随着原子数量的增加,这需要消耗大量的内存和时间。新的系统 DPA4C 改变了这种基本架构。它不再进行复杂的双向数据传递,而是通过一步直接计算邻近原子的影响。它观察原子之间的距离及其化学类型,然后使用预先计算好的查找表来确定它们的相互作用。这种设计意味着模型不需要为大规模系统中每一个连接都存储一个独特的、复杂的特征状态。

这种架构上的转变使得研究人员能够大幅压缩模型的内存占用。想象一下这样一个图书馆:与其为每两个人的每一次对话都写一本独特的书,不如拥有一本精简的参考指南,根据谈话者是谁以及他们之间的距离来告诉您应该说什么。研究人员构建的模型正是以这种方式工作的。他们利用涵盖广泛元素和化学环境的庞大原子相互作用数据集对系统进行了训练。一旦完成训练,描述这些相互作用的复杂数学函数就被转换成了简单的固定表和缓存。在模拟运行时,计算机只需查找这些数值,而不是为每一对原子重新计算复杂的方程。这使得系统能够在仅使用极小比例的内存和处理能力的同时,保持极高的精度。

这种方法的成果令人瞩目。研究人员测试了五个不同版本的模型,从一个非常紧凑的版本到一个更大、更详细的版本。即使是使用最少计算资源的最小版本,其准确度也显著高于当时现有的最快通用模型。在涉及钻石和铜的测试中,这个紧凑版模型的运行速度几乎是之前速度纪录保持者的两倍,同时将能量和力的计算误差降低了一半以上。更大版本的模型在接近现有最精确方法精度的同时,运行速度提高了约一百倍。这意味着,以前需要在最强大的超级计算机上运行数周的模拟,现在可以在标准硬件上仅用一小部分时间即可完成。

该系统的力量不仅在于其在单台计算机上的速度,还在于当多台计算机协同工作时其表现出的扩展性。研究人员展示了他们的模型可以在一千个图形处理器(GPU)上运行涉及超过二十亿个原子的模拟。在这种大规模设置中,系统保持了超过 83% 的效率,这意味着增加更多的计算机几乎可以完美地提升模拟速度。这种能力为研究此前难以触及的现象打开了大门,例如整个微芯片规模下的材料行为,或是大型生物系统内部的复杂相互作用。该模型成功处理了在单个图形卡上运行数百万个原子的系统,这对于具有如此高精度的模型来说,在以前是无法想象的。

这项发展的特别之处在于,它并不依赖于单一类型的材料或特定的化学成分。该模型被训练为是“通用的”,这意味着它可以处理各种元素和混合物,而无需针对每个新场景进行重新训练。这种通用性对于研究现实世界的材料至关重要,因为现实材料通常是复杂的合金或由多种不同元素组成的混合物。通过将这种广泛的化学范围、近乎量子的精度以及经验势的运行速度相结合,研究人员创造了一个能够最终模拟驱动现代技术和材料科学的复杂多组分系统的工具。这项工作表明,只要在设计时考虑到现实世界部署的约束条件,就可以克服原子模拟中长期存在的精度与速度之间的权衡。

研究人员还仔细测试了系统的极限。他们发现,虽然该模型在短程相互作用方面表现出色,但它并未明确考虑长程电磁力或色散力,而这些对于某些类型的材料而言是非常重要的。然而,对于固体和液体中出现的大多数化学键合场景,该模型的表现具有极高的可靠性。团队验证了使用查找表的压缩版本模型所产生的计算结果与未压缩版本几乎完全一致,从而证实了压缩并未牺牲精度。他们还展示了该模型可以处理带电分子和开壳层系统,从而扩大了其在简单固体材料之外的应用范围。

最后,这项工作代表了科学家对待物质模拟方式的一种转变。通过重新思考机器学习模型的底层架构,使其优先考虑效率和可压缩性,该团队解锁了一个全新的性能境界。他们证明了,建立一个既能跨越化学领域实现通用,又具备足以进行关键预测的精度,且运行速度快到足以处理数十亿个原子的规模的模型是完全可能的。这一成就使该领域从一种妥协的状态转向了能力跃迁的状态,让研究人员能够去探究那些此前因规模过大或复杂度过高而无法模拟的材料与分子问题。未来的路径包括将这些方法扩展到包含长程相互作用,并进一步优化模型以应对更加专门化的应用,但基础已经牢固地奠定了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →