Active Learning Enables Generation of Molecules that Advance the Known Pareto Front
本文介绍了一种闭环主动学习流水线,该流水线通过在量子化学模拟数据上进行迭代重训,以克服静态模型的泛化局限性,成功生成了性质显著超过原始训练分布的可合成分子。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
寻找新分子是一场寻找完美构建模块的探索之旅,这些模块可用于从太阳能电池到救命药物的一切领域。几十年来,科学家们一直依赖于已知的化学物质的大型数字库,逐一筛选那些具有合适属性的分子。但可能存在的分子宇宙如此浩瀚——据估计其数量远超天上的繁星——以至于检查所有分子是不可能的。最近,一种新的方法出现了:使用计算机程序从头开始发明全新的分子,并使其具备特定的、理想的特征。人们希望这些人工智能系统能够穿越这片无尽的化学空间,找到人类数据库从未见过的解决方案。
然而,一个顽固的问题一直阻碍着这些数字发明家发挥其全部潜力。虽然它们擅长重新组合熟悉的构思,但当被要求涉足真正未知的领域时,往往会步履维艰。问题不在于这些发明家缺乏想象力,而在于它们用来评判自身创造物的工具在训练范围之外是不可靠的。当一个计算机程序建议一种新颖的分子时,另一个程序必须预测其行为。如果这个预测工具只见过常见的例子,那么在面对真正新颖的事物时,它往往无法做出正确预测,从而将发明家引向死胡同。劳伦斯利弗莫尔国家实验室的一组研究人员现在展示了如何修复这一盲点。通过创建一个自我修正的闭环,使计算机的预测不断接受严格物理模拟的检验,他们使系统能够发现不仅是全新的,而且显著优于现有记录中任何分子的分子。
研究人员专注于一个特定的挑战:设计既具有高密度又具备储能能力的分子,这些属性对于先进材料至关重要。他们从一个能够生成新化学结构的标准计算机程序开始。在典型的设置中,该生成器会创建一个分子,然后由一个单独的预测模型来估算其属性。基于该估算结果,生成器会调整设计并再次尝试。但研究人员发现,这个过程遇到了瓶颈。由于仅在已知数据上进行过训练,预测模型无法准确判断与其见过的数据过于迥异的分子。因此,生成器从未能深入探索到足以发现真正卓越设计的程度,实际上一直停留在已知世界的安全范围内。
为了打破这一循环,团队引入了一个充当“现实检查”的“闭环”系统。该系统不再仅仅依赖初始预测模型,而是构建了一个流程:计算机生成的每一个候选分子都要接受高保真物理模拟。这种模拟是一种基于量子力学定律的复杂计算,用于确定分子的实际密度、能量和稳定性。至关重要的是,这些模拟结果并不会被丢弃;它们会被反馈回系统以重新训练预测模型。随着每一轮测试的进行,预测模型都在学习生成器正在探索的新化学区域。它变得更擅长评判那些它此前难以处理的事物,从而让生成器能够更有信心地向未知的领域推进。
这一迭代过程被证明是具有变革意义的。虽然标准的计算机模型无法产生任何超越其训练数据中最佳案例的分子,但新的闭环系统成功了。经过四轮这种自我修正循环后,该系统生成的分子密度超过了每立方厘米2克,超越了原始包含1万多个已知分子的数据集中的最高密度。此外,该系统还发现了能量存储能力突破以往认知极限的分子。研究表明,这些突破的关键不在于一个更聪明的生成器,而在于一个更可靠的评判者。在利用新模拟数据进行重新训练后,预测模型的准确性大幅提升,在评估这些新颖结构时,其误差减少了高达90%。
分子发现中的另一个关键障碍是确保计算机设计的结构确实可以在实验室中制造出来。许多理论上的分子在化学上是不稳定的,会立即分解。研究人员通过利用来自物理模拟的数据,训练了一个专门的分类器来识别不稳定的迹象。通过在生成之前过滤掉不稳定的候选者,该系统产生的最终分子集比其他领先方法的稳定性高出3.5倍。这种稳定性至关重要,因为它表明这些分子不仅仅是理论上的奇珍异宝,而是潜在的现实世界合成候选物。
这些发现表明,我们在发现新材料的方法上正在发生转变。研究指出,创造更好分子的瓶颈通常不在于想象新结构的能力,而在于无法可靠地预测其行为。通过将生成式模型的创造力与严格的、自我改进的验证过程相结合,研究人员展示了可靠地扩展已知化学性能边界的可能性。其结果是,该系统不仅是在回收旧思想,而是在积极扩张可能性的前沿,寻找那些位于传统方法触及范围之外的、稳定且高性能的分子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。