← 最新论文
🔬 materials science

Data-Efficient Training of Linear ACE Potentials through Leverage-Guided Subset Selection of ASSYST Structure Pools

本文表明,通过杠杆引导的、无标签的 ASSYST 结构池子集选择,可以在保持与随机采样及其他基准采样策略相比具有竞争力的能量、力以及缺陷水平保真度的同时,显著降低训练准确的线性原子簇展开(ACE)势函数所需的 DFT 标注工作量(达 2–3 倍)。

原作者: Aynour Khosravi, Marvin Poul, Jörg Neugebauer, Chad Sinclair

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Aynour Khosravi, Marvin Poul, Jörg Neugebauer, Chad Sinclair

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的材料搜寻:为什么我们需要更智能的地图

想象一下,你是一名试图建造摩天大楼的建筑师,但你没有蓝图,每次想增加一层楼时,都必须从头开始计算每一块砖、每一个螺栓和每一根梁的物理特性。这本质上就是科学家在模拟材料行为时面临的困境。为了理解为什么金属会弯曲、电池为何会退化,或者一种新合金在压力下会如何表现,他们需要知道“势能面”——一张巨大的、无形的地图,它告诉他们在每一种可能的原子排列下存储了多少能量。

绘制这张地图最精确的方法是使用一种被称为“密度泛函理论”(DFT)的高精度方法。可以将 DFT 想象成一位大师级的制图师,他可以绘制出细节完美的地图,但绘制仅仅一平方英里的地图就需要耗费数天时间。如果你想模拟一整座城市(或拥有数十亿个原子的金属块),你可能需要等待的时间比宇宙的寿命还要长。为了解决这个问题,科学家们使用了“机器学习原子间势函数”(MLIPs)。它们就像是向大师学习的学生制图师。一旦经过训练,它们几乎可以瞬间绘制出地图,从而让我们能够模拟大规模系统。但问题在于:为了训练这个学生,大师仍然需要先绘制出数千个那样微小且昂贵的平方英里。问题是:在学生掌握正确方法之前,大师究竟需要绘制多少个平方英里?

论文的核心思想:寻找“黄金点”

这篇论文解决了这个确切的问题。研究人员利用一个名为 ASSYST 的工具(该工具会自动生成一个包含大量随机、奇特且奇妙的原子结构的库),提出了一个简单的问题:如果我们有一个包含 20,000 个潜在结构的资源池,我们真的需要支付“DFT 税”来标记所有这些结构吗?还是我们可以挑选一个更小、更聪明的子集,从而同样有效地教导计算机模型?

他们测试了一种被称为杠杆引导选择(Leverage-Guided Selection)的聪明策略。想象一下,你正在学习一座新城市的布局。你可以走遍每一条街道(随机采样),或者你可以看一眼地图,挑选出那些连接了最多独特社区的街道(杠杆选择)。论文中的方法利用数学手段来寻找资源池中最“独特”的原子排列——即那些能填补模型知识中最大空白的排列——而无需预先知道昂贵的能量值。他们称之为“无标签”(label-free),因为该方法只观察原子的形状,而不关注其计算出的能量。

他们的发现:
结果非常高效。对于铝和铜等纯金属,研究人员发现,通过使用这种“智能挑选”方法,他们训练出的模型仅需使用随机挑选所需数据的 30–40%,即可达到相同的准确度。换句话说,他们通过仅进行三分之一的高昂工作,就完成了高质量地图的绘制。这实现了 2 到 3 倍的计算成本降低

“陷阱”与细微差别:
论文谨慎地指出,这并非魔法。虽然“智能挑选”对纯元素效果显著,但对于复杂合金(铝和铜的混合物)的结果则更为微妙。

  • 对于有序合金: 一旦模型见识了足够多类型的化学环境,使用智能方法挑选 25% 的数据所获得的结果,就与随机挑选 50% 的数据一样好。
  • 对于稀释合金(在另一种金属中加入少量另一种金属): 智能方法的表现更加出色,它在将所需数据减半的同时,还提高了针对特定缺陷(如空位/缺失原子)的准确度。

他们排除了什么:
该研究明确反对仅仅根据前一次预测错误的程度来挑选“最难”或“最奇怪”结构的观点(这是一种基于能量或力误差的“主动学习”方法)。他们发现,虽然基于巨大误差的选择在初期确实有一定帮助,但这种方法并不稳定,且无法像他们的杠杆法那样全面覆盖整个“地图”。论文指出,单纯寻找最大的错误,在效果上不如寻找最具“信息量”的几何空白。

他们的信心何在?
作者对这些数字非常有信心,因为他们进行了严格的测试。他们不仅仅是猜测,而是运行了五次具有不同随机种子的模拟,以确保结果并非偶然。他们还利用完全独立的测试集(模型未曾见过的结构)对模型进行了验证,并检查了诸如晶界和空位等特定的困难场景。论文表明,这种“几何优先”的方法是一种稳健且具有统计学依据的方法,可以节省时间和资金;但同时也指出,对于极其复杂的多元合金,仍需更多测试来确定其极限所在。

简而言之,论文表明,如果你想教会计算机理解材料,你不需要展示每一个例子。你只需要展示正确的例子。通过使用数学指南针来寻找最独特的原子形状,科学家可以利用显著减少的计算能力来构建更好的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →