← 最新论文
🔬 materials science

SoLiD26: A First Principles Solid-Liquid Interface Dataset for Machine-learned Interatomic Potentials

本文介绍了 SoLiD26,这是一个包含 1540 万个第一性原理原子结构的综合数据集,涵盖了多样化的固液界面,旨在为电化学、催化和腐蚀领域的机器学习原子间势函数训练与基准测试提供支持。

原作者: Jonas Busk, Emil J. P. Frost, Yogeshwaran Krishnan, Henrik H. Kristoffersen, August E. G. Mikkelsen, Xueping Qin, Xin Yang, Heine A. Hansen, Arghya Bhowmik, Tejs Vegge

发布于 2026-09-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonas Busk, Emil J. P. Frost, Yogeshwaran Krishnan, Henrik H. Kristoffersen, August E. G. Mikkelsen, Xueping Qin, Xin Yang, Heine A. Hansen, Arghya Bhowmik, Tejs Vegge

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在材料科学的隐秘世界中,一些最关键的过程并非发生在固体块的中心或液体的自由漂浮状态中,而是恰恰发生在两者交汇之处。这个被称为固-液界面的边界,是电池充电、催化剂加速化学反应以及金属开始腐蚀的地方。为了理解这些过程,科学家们依赖于计算机模拟,这些模拟就像虚拟显微镜,让他们能够观察原子的运动与相互作用。几十年来,实现这一目标最准确的方法是根据量子力学定律,为系统中的每一个原子求解复杂的方程。虽然这种方法极其精确,但由于计算量巨大,它只能模拟极少数原子在极短时间内的行为,就像是在观看电影中的单个画面。要看到电池退化或催化剂工作的完整故事,研究人员需要模拟数百万个原子在更长时间内的行为,而这正是传统方法无法胜任的任务。

为了弥补这一差距,科学家们开发了被称为“机器学习原子间势函数”的新一代工具。可以将它们想象成智能捷径:计算机程序首先通过缓慢但准确的量子力学方法进行学习,然后学会如何以惊人的速度预测原子的行为,从而实现对大规模系统的模拟。然而,为了让这些“捷径”在固体与液体相遇的混乱且复杂的现实世界中发挥作用,它们需要基于专门捕捉这种独特环境的数据进行训练。直到现在,大多数训练数据都侧重于孤立的分子或完美的晶体,导致在固体与液体如何相互作用方面的知识存在空白。来自丹麦技术大学的一个研究小组现在填补了这一空白,他们创建了一个专门针对这些界面设计的庞大且专业的数据库。

研究人员由 Jonas Busk 和 Tejs Vegge 领导,他们汇编了一个名为 SoLiD26 的数据集。这不仅仅是一个小规模的示例集合,而是一个包含超过 1500 万个不同原子结构的庞大档案库。每个结构都代表了一个固体金属与液态水或电解质相遇的系统快照,捕捉了原子在排列、结合和断裂过程中那充满混沌感的舞蹈。该数据集包含多达 576 个原子的系统,并涵盖了 15 种不同的化学元素,范围从常见的氢和氧到贵金属如金、铂和铜。这些快照是使用一种称为密度泛函理论(DFT)的严谨方法生成的,该方法能够高精度地计算作用在每个原子上的能量和力。团队从以往关于水性金属界面和电化学系统的众多研究中收集了这些计算数据,然后将它们仔细清洗并整理成一个统一且连贯的资源。

构建这个数据集的过程极其细致。研究人员首先从各种项目中收集原始数据,但他们深知并非所有数据都是同等质量的。他们过滤掉了使用不一致设置或包含错误的计算,例如那些原子受力异常高的结构。他们还删除了重复条目,以确保机器学习模型不会因为过度接触同一个例子而产生偏差。为了捕捉那些可能逃过简单检查的微妙错误,他们使用了一个初步的机器学习模型来扫描数据中的离群值——即那些模型无法很好预测的奇异结构,这些结构通常预示着原始计算存在问题。这种严格的清洗过程确保了最终的库只包含高质量、可靠的信息,从而为训练新的 AI 模型提供了值得信赖的基础。

检验这个数据集真实价值的方法,是看它是否真的能教会机器学习模型比现有模型更好地理解固-液界面。团队采用了一个功能强大的预训练 AI 模型,并用他们的新数据对其进行训练。他们将这个新模型与原始的预训练版本以及一个基于新数据从头开始训练的模型进行了对比。结果非常明确:在预测这些复杂系统内的能量和力时,经过 SoLiD26 训练的模型误差显著降低。具体而言,在预测原子如何相互推力和拉力方面的误差降到了之前的约三分之一。这一改进表明,该数据集成功地教会了 AI 那些支配固体与液体共同行为的独特规则,而这些规则在之前使用的通用训练数据中是缺失的。

尽管该数据集是一个重要的进步,但研究人员谨慎地指出,它是一个开发工具而非最终解决方案。基于此数据训练的模型仍需进一步完善,且目前的测试主要集中在特定类型的化学元素和系统规模上。然而,这个包含原子位置、力和能量详细记录的 100 GB 库文件的可用性,为全球科学家构建更好的模拟实验打开了大门。通过提供一个用于固-液界面的共享、高质量资源,SoLiD26 让研究人员能够超越小规模模拟的局限,开始对驱动我们能源未来的复杂现实材料进行建模。这项工作证明,只要拥有正确的数据,机器学习终究可以应对化学与物理碰撞时那错综复杂的边界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →