Let CSP Be Your ANCHOR: Adaptive Crystal Search over Frozen Structure Priors
该论文引入了 ANCHOR,这是一个通过采用冻结的晶体结构预测(CSP)模型作为固定物理先验,并使用经过 GRPO 训练且具有自适应新颖性奖励的策略来优化成分选择,从而将晶体结构生成与成分搜索解耦的框架,由此与传统的端到端从头生成方法相比,显著提高了发现独特、稳定且新颖晶体结构的效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
寻找新材料是一场寻找完美原子排列的探索。晶体固体——这些构成从计算机芯片到电池电极等一切事物的有序结构——是解决人类面临的重大能源和环境挑战的关键。然而,可能的晶体组合宇宙如此浩瀚,以至于寻找一种稳定且有用的组合就像是在一个星系大小的草堆中寻找一根针。几十年来,科学家们一直依赖两种主要方法来解决这个谜题。第一种是在已知化学配方后预测晶体结构。第二种是从零开始生成全新的材料,同时发明配方和结构。虽然现代计算机模型在给定成分后猜测晶体外观的能力已变得非常出色,但它们往往难以决定哪些成分值得尝试。它们倾向于固守以前见过的配方,从而错失了那些位于其训练数据之外的罕见且稳定的组合。
来自丹麦技术大学和南丹麦大学的研究团队提出了一种导航这一广阔化学空间的新方法。他们认为,计算机猜测结构的能力与其选择配方的能力是两种不同的技能,不应被强行作为一个整体来运作。在他们被称为 ANCHOR 的新系统中,他们将这些任务完全分离。他们采用了一个强大的、预训练的模型作为“结构先验”——一个可靠且不变的专家,该专家知道如何为任何给定的成分构建稳定的晶体。这个专家模型是冻结状态的,这意味着在搜索过程中它永远不会被改变。相反,一个独立的、具有适应性的“搜索智能体”被训练用来决定向这位专家提议哪些化学配方。该智能体通过试错学习,当它建议的配方能产生稳定、独特且前所未有的晶体时,就会获得奖励。
研究人员发现,当他们让搜索智能体引导过程时,结果得到了显著改善。通过保持结构专家处于冻结状态,并仅训练智能体去选择更好的配方,他们将发现稳定、独特且新颖晶体的速率从 11.4% 提高到了 47.6%。这是一个巨大的效率飞跃。相比之下,当他们尝试同时训练整个系统——即让模型同时改变其配方选择和结构构建规则时——系统趋于崩溃。它会开始反复重复同样的几种配方,或者会漂移向那些易于评分但在物理上不稳定的化学组合。研究表明,试图同时优化整个模型往往会导致多样性的丧失,即计算机会陷入重复发现旧材料的循环之中,而不是寻找新材料。
这项工作的一个关键创新在于衡量“新颖性”的新方式。传统方法会将新晶体与已知材料的固定数据库进行比对。如果它不匹配,就会获得奖励。然而,这种方法存在缺陷:如果计算机发现了一个新晶体,随后又再次发现了它,它仍会获得相同的奖励,从而鼓励它浪费时间去重新发现已知的事物。ANCHOR 系统使用了一种“连续自适应新颖性”评分。该评分不仅检查新晶体与固定数据库的关系,还检查其与系统自身不断增长的发现历史之间的关系。如果系统已经发现过某种特定结构,评分就会降至零,有效地告诉搜索智能体:“你已经见过这个了;试试别的。”这一简单的规则防止了搜索陷入循环,并迫使它不断探索新的领域。
研究人员还发现,奖励的应用方式与奖励本身同样重要。当他们尝试通过喂入奖励来直接改进结构模型时,模型寻找稳定晶体的能力反而下降了。模型学会了钻系统的漏洞,产生了一些在理论上看起来很好但在物理上并不稳定的结构。然而,当他们利用搜索智能体发现的结构在稍后对结构模型进行重新训练时,模型得到了改进。这表明存在明确的分工:搜索智能体应当通过探索化学空间来寻找有前景的配方,而结构模型应当在随后利用搜寻过程中发现的最佳实例进行精炼。
这种方法的成果具有重要意义。在材料领域通用的标准测试条件下,ANCHOR 系统的发现稳定、独特且新颖晶体的成功率达到了 41.3%,超过了此前 29.2% 的最佳结果。更令人印象深刻的是,该系统能够将其知识迁移到不同的结构模型中而无需重新训练,证明了其搜索策略的鲁棒性和适应性。研究结论指出,发现新材料的瓶颈不在于构建晶体的能力,而在于选择用于构建晶体的正确化学配方的能力。通过将配方搜索与结构构建相分离,并结合一种具备历史感知能力的智能评分系统,研究人员展示了一条更高效、更有效的材料发现之路。这项工作表明,寻找新材料的未来不在于构建更大、更复杂的模型,而在于更智能地组织搜索过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。