A single design choice determines whether machine learning models of materials make physically impossible predictions
本文表明,将宇称标签纳入机器学习模型的特征是一个关键的设计选择,它保证了中心对称晶体中对称禁戒性质的物理精确预测,而缺乏该特征的模型在几乎所有情况下都会产生物理上不可能的误差,且不会牺牲准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在探索新材料的过程中,科学家们长期以来一直依赖一种强大的捷径:利用对称性规则来预测晶体的行为。晶体并非原子的随机堆积;它们是高度有序的结构,原子在其中以精确的模式重复。由于这种有序性,物理定律规定某些属性必须以特定的方式表现。例如,如果一个晶体在通过其中心进行旋转(即倒转)后看起来完全相同——这种性质被称为中心对称(centrosymmetry)——那么它在受到挤压时就无法产生电能。这并不是因为材料性能较弱或测量不精确,而是一条硬性的自然法则。如果晶体具有这种中心对称性,其电响应必须精确为零。
几十年来,研究人员一直使用基于量子力学的复杂计算机模拟来计算这些属性。然而,今天一种更快速的方法正在占据主导地位:机器学习。这些人工智能模型通过学习已知晶体的庞大数据库来训练,从而预测材料属性。它们正成为发现电池、太阳能电池和电子设备中新物质的主要工具。人们希望这些模型能够像人类物理学家一样学习对称性规则,甚至可能做得更好——通过发现人类可能忽略的数据模式。但这种速度也伴随着风险:如果模型没有严格遵守基本的对称性法则,它可能会预测出自然界所禁止的现象,例如在物理上无法产生电能的情况下生成电能。
由德州农工大学及其他机构的研究人员开展的一项近期研究揭示了许多这类流行的机器学习模型在构建过程中存在的一个惊人缺陷。该团队发现,一个模型是否尊重这些绝对的物理定律,并不取决于它看到了多少数据或训练了多久,而是取决于在训练开始前做出的一个微小的单一设计选择。这个选择在于模型的内部“特征”(即它用来理解晶体形状的数学构建模块)是否携带一个被称为“宇称”(parity)的特定标签。宇称是一种追踪形状在镜像反射或翻转时如何变化的方式。研究人员发现,如果一个模型缺乏这个标签,那么无论它如何努力,在数学上都无法预测出对称性所要求的精确零值。它总是会产生一个微小的非零值,而这代表了一个物理上不可能的预测。
为了证明这一点,研究人员设置了一项严谨的测试,使用的是一种称为压电张量(piezoelectric tensor)的属性,该属性衡量晶体在受压时产生多少电能。他们专注于两千种已知的具有中心对称性(即具有对称中心)的晶体。根据物理定律,所有这些晶体的压电响应必须精确为零。该团队选取了几种目前领域内最先进的机器学习模型,并为每个模型创建了两个版本。一个版本在构建时包含了宇称标签,而另一个版本在其他方面与它完全相同,但没有包含这些标签。随后,他们使用相同的数据训练这两个版本的模型,并要求它们预测这两千种中心对称晶体的压电响应。
结果是剧烈且直接的。带有宇程标签的模型对每一个晶体都预测出了零值,达到了计算机精度的极限。它们正确地识别出这些材料无法产生电能。相比之下,没有宇程标签的模型表现得极其糟糕。它们对90%到96%的晶体预测出了非零的电响应。这些预测并非微小的误差;它们往往与那些可以产生电能的材料的实际电响应相当。这两个群体之间的差异不仅仅是几个小数点的问题,而是六个数量级的差距,这意味着“错误”的模型预测物理上不可能发生的事件的可能性比“正确”的模型高出一百万倍。
研究人员随后测试了训练是否能解决这个问题。他们向“错误”的模型喂入额外的数据,特别是展示了一些具有正确“零”标签的中心对称晶体示例,希望模型能够学会遵守这一规则。但这并没有奏效。即使在看了成千上脸关于答案为零的例子之后,这些模型仍然会预测出非零值。它们可以接近于零,但永远无法达到物理定律所要求的精确零值。研究还表明,仅仅对模型的预测结果及其镜像结果进行平均并不能解决问题,因为模型本身的底层结构对对称性规则是“盲目”的。
这一发现对材料科学领域具有深远的影响。它表明,机器学习模型的可靠性不仅取决于它在标准测试中的准确性,更取决于其代表物理现实的结构能力。研究人员审计了目前正在使用的18种不同的机器学习架构,发现其中恰好有一半缺乏必要的宇程标签。这意味着,科学家们用来发现新材料的工具中,有很大一部分在根本上无法对一大类晶体做出正确的预测。问题不在于这些模型不擅长学习,而在于它们的设计阻止了它们学习这一特定的真理。
研究还强调了该领域的一个日益增长的趋势,即科学家们采用一个已经学习了原子通用结构的预训练模型,然后在其上附加一个新的“头”(head)来预测特定的属性。研究人员指出,如果原始模型在构建时没有包含宇程标签,那么新的属性预测器也会继承这个缺陷。无论新设计的部件多么精巧,如果基础部分缺失了对称性标签,整个结构都将无法尊重物理定律。这意味着,是否包含该标签的决定是在上游阶段做出的,通常是由基础模型的创建者决定的,而这个决定会默默地决定后来任何使用该模型的人所做预测的有效性。
最终,论文认为,要使机器学习在科学领域真正值得信赖,必须将其物理定律植入其结构之中,而不仅仅是从数据中学习。研究人员提出了一个简单的检查方法:在信任一个模型预测由于对称性而应为零的属性之前,可以通过对一个随机晶体结构应用镜像反射来进行秒级的测试。如果模型预测出了非零值,则说明它缺乏必要的宇程标签,因此无法用于该任务。这不仅是一个改进建议,更是物理有效性的要求。研究结论指出,宇程标签的存在与否决定了一个模型是发现工具还是产生不可能预测的来源,而这是一个在搜索新材料时必须报告并验证的细节。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。