BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
本文介绍了 BOOM,这是首个用于系统性评估分子属性预测中分布外(OOD)泛化能力的化学启发式开源基准测试,它揭示了当前的机器学习模型在超越其训练数据进行外推方面存在困难,并强调了开发新方法以实现稳健 OOD 性能的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
探索新药和新材料的征程往往始于一个简单却又令人畏惧的问题:在数十亿种可能的化学结构中,究竟哪些才真正有效?几十年来,科学家们一直依赖于试错法,但新一波的人工智能有望通过在分子被实际构建之前预测其行为,来加速这一过程。这些计算机模型通过对已知化学物质的大规模库进行训练,学习识别将分子的形状与其属性(例如其在水中的溶解度或燃烧时释放的能量)联系起来的模式。人们希望这些模型随后能够观察一个全新的、从未见过的分子,并准确地猜测其行为,从而有效地让研究人员能在计算机屏幕上设计化学的未来。
然而,这里有一个显著的陷阱。大多数此类人工智能模型擅长识别其受训数据中的模式,但当被要求预测与训练库中任何内容都截然不同的分子属性时,它们往往会出错。在机器学习领域,这被称为“分布外”(out-of-distribution)问题。这就像是一个学生记住了练习题的答案,而不是一个能够解决全新、意外问题的学生。如果一个模型无法超越其训练数据进行泛化,它就会变成一个证实已知事实的工具,而非发现未知领域的工具。这种局限性是下一代药物研发和材料科学的主要瓶颈,因为这些领域的目标是寻找那些能够突破现有边界的分子。
来自劳伦斯利弗莫尔国家实验室和宾汉姆顿大学的研究团队针对这一问题进行了深入研究,并提出了一个名为 BOOM 的新基准测试。研究人员并没有仅仅测试模型在熟悉数据上的表现,而是设计了一套严苛的测试集,专门用于观察这些人工智能系统是否能够处理陌生数据。他们收集了包含数千种分子的十个不同数据集,涵盖了从小型有机化合物到具有特定电子结构的复杂结构。对于每个数据集,他们仔细地将分子分为三组:训练集、包含熟悉分子的标准测试集,以及一个特殊的“分布外”测试集。这个特殊组由具有极端属性的分子组成——这些数值过高或过低,在训练数据中极少出现。研究人员随后让十五种不同的机器学习模型接受了测试,要求每种模型预测这些极端分子的属性。
结果令人清醒。尽管现代人工智能拥有令人印象深刻的能力,但研究发现,没有任何单一模型能够持续准确地预测这些极端分子的属性。即使是表现最好的模型,在处理这些困难的、未见的案例时,其误差也比处理熟悉数据时的误差大出三倍。研究人员观察到一种常见的失效模式:模型擅长将相似的分子归为一类,但在将预测延伸至未知领域时却失败了。模型并没有尝试去猜测一个真正超出其所见范围的数值,而是倾向于压缩其预测值,将极端值拉回到平均值附近。这种行为表明,这些模型正在学习一些在处理标准数据时行之有效、但在面对科学发现所需的真正新颖性时会失效的“捷径”。
该团队还调查了模型为何表现不佳,并测试了几种常见的修复策略。他们研究了在包含数十亿个分子的海量数据集上对模型进行预训练(这一技术彻底改变了语言模型)是否会有所帮助。令人惊讶的是,他们发现虽然预训练使模型更好地处理了熟悉的数据,但并未提高其预测极端值的能力。事实上,对于某些模型而言,预训练反而降低了其在分布外数据的表现。他们还测试了仅仅向训练集中添加更多数据是否会有所帮助。虽然加入少量极端示例可以改善某些属性的表现,但这并非万能良药。研究表明,这些模型的构建方式——特别是它们对基于文本的分子表示形式的依赖——可能从根本上限制了它们理解支配化学行为的深层物理定律的能力。
其中最具有启发性的发现之一是,数据表示的类型比模型的大小更为重要。使用原子及其位置的三维几何信息的模型,其表现明显优于依赖线性文本字符串(类似于按序列书写的化学名称)的模型。这些尊重空间物理对称性的三维模型能够更好地泛化到极端情况。这指明了一个清晰的前进方向:要构建能够真正发现新化学成分的 AI,模型需要植根于原子如何运动和相互作用的物理现实,而不仅仅是基于它们如何被文本描述的模式。研究人员得出结论,要实现对这些困难任务的强大性能,可能需要结合更大规模、更多样化的数据集,以及明确理解分子电子结构的模型。
BOOM 基准测试为该领域提供了一次现实检验,表明当前一代的化学 AI 虽然强大,但尚未准备好可靠地航行于未知领域。这项研究并不声称问题是不可解决的,但它排除了仅仅通过扩大现有模型的规模或使用标准预训练技术就能解决问题的观点。相反,它强调了化学机器学习的下一个前沿需要转变其设计思路。通过提供一种测试这种特定弱点的标准化方法,研究人员希望引导整个领域去构建不仅擅长记忆过去,而且真正有能力想象未来的模型。发现下一代救命药物和先进材料的路径,可能取决于解决这个关于泛化能力的特定谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。