← 最新论文
🔬 materials science

Probing out-of-distribution generalization in machine learning for materials

这项研究表明,材料科学机器学习中常见的启发式评估往往高估了泛化能力和神经缩放带来的益处,因为它们主要测试的是训练域内的插值,而非真正的分布外外推,而在后者中,增加数据或模型规模会产生递减或不利的回报。

原作者: Kangming Li, Andre Niyongabo Rubungo, Xiangyun Lei, Daniel Persaud, Kamal Choudhary, Brian DeCost, Adji Bousso Dieng, Jason Hattrick-Simpers

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Kangming Li, Andre Niyongabo Rubungo, Xiangyun Lei, Daniel Persaud, Kamal Choudhary, Brian DeCost, Adji Bousso Dieng, Jason Hattrick-Simpers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在探索新材料的过程中,科学家们越来越多地转向人工智能,以加速这一进程。想象一个包含数百万种不同物质配方的庞大图书馆,每种配方都拥有独特的属性,如强度、导电性或形成所需的能量。传统上,寻找一种新材料意味着要在实验室里一个接一个地测试配方,这是一项缓慢且昂贵的任务。机器学习提供了一条捷径:通过研究现有的图书馆,计算机可以学习化学规则,并预测它从未见过的材料属性。最终目标是构建真正通用的模型,这意味着它们可以对完全新型的物质做出准确预测,而不仅仅是那些看起来与已研究过的物质相似的物质。这种处理未知情况的能力对于解决全球性挑战至关重要,从制造更好的电池到设计更高效的太阳能电池板。然而,关于这些数字工具在面对真正陌生的事物时表现究竟如何,仍然存在一个悬而未决的问题。

一个研究小组致力于测试这些机器学习模型在材料科学领域的极限。他们想知道这些模型是真的学习了自然的深层规律,还是仅仅记住了那些恰好看起来像新发现的模式。为此,他们设计了一个涉及 700 多个不同挑战的大规模实验。在每个挑战中,他们利用大量已知材料训练计算机模型,然后要求它预测一组完全不在其训练数据中的特定材料。这些组别是根据特定规则定义的,例如“所有含有某种元素的材料”或“所有具有特定晶体形状的材料”。研究人员测试了各种各样的模型,从简单的成熟算法到模仿人类大脑的复杂现代神经网络。

结果令人惊讶。在 700 个挑战中的绝大多数情况下,模型的表现异常出色,即使测试材料中包含了它们在训练期间从未遇到过的元素或结构。使用基本决策规则的简单模型,其表现往往与最先进的深度学习系统一样好。这种高水平的成功表明,模型在泛化到新化学领域方面并没有像之前认为的那样困难。然而,研究人员进行了更深入的研究,以了解为什么会发生这种情况。他们发现,“新”在这些测试中的定义往往具有误导性。虽然测试材料在化学成分上是不同的,但它们通常占据了模型用来理解材料的数学空间中的大致相同区域。换句话说,模型并不是真的在探索未知,而是在填补已知知识之间的空白。

为了证明这一点,团队绘制出了这些材料所处的数学景观图。他们发现,在模型成功的任务中,新材料实际上被训练数据包围着,这使得模型可以根据附近的例子做出安全的猜测。但当他们观察那少数几个模型失败的任务时,他们发现测试材料是真正孤立的,远离了模型所见过的任何数据。这种区别揭示了该领域衡量成功方式的一个关键缺陷。许多被誉为证明模型处理未知能力能力的测试,实际上只是对其插值(即在已知点之间进行猜测)能力的测试。模型并未展示出向化学空间遥远之处进行外推的魔力;它们只是在自己已经理解的区域内连接点与点。

这项研究还挑战了一个在人工智能领域广为人知的观点,即“规模化”(scaling)。普遍的看法是,如果你仅仅扩大训练数据集或让模型训练更长时间,其泛化能力总会提高。研究人员通过向模型输入越来越多的数据来测试这一点。对于新材料接近旧材料的简单任务,性能确实随着数据的增加而提高。但对于那些真正的困难任务,即材料位于训练区域之外很远的地方,增加数据或训练时间并没有帮助。在某些情况下,这甚至使模型变得更糟,导致它们对已知数据产生过拟合,从而失去了正确猜测未知情况的能力。这表明,当涉及到真正的创新材料时,通过规模化来解决所有泛化问题的承诺被夸大了。

研究人员得出结论,该领域需要更加谨慎地定义和测试泛化能力。目前的评估方法依赖于简单的规则来分离训练数据和测试数据,这往往会创造成功的幻象。这些方法展示了模型擅长处理的内容,但并不一定证明这些模型能够应对驱动未来科学突破的真正困难的挑战。这项研究并不是说机器学习正在失败;相反,它表明我们一直在问错误的问题。通过认识到我们的许多“困难”测试实际上对模型来说相当容易,科学家现在可以专注于设计真正困难的挑战。这种转变将有助于识别我们理解中的真实差距,并指导开发能够真正航行在材料科学未知领域的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →