Margin-calibrated Classifier Guidance for Property-driven Synthesis Planning
本文介绍了序列完成排序(SCR),这是一种经过边际校准的分类器引导方法,它通过使预训练的自回归模型能够有效满足特定反应约束和性质目标,显著提升了多步化学合成规划的效果,从而大幅提高了求解率,并弥合了基于模板与无模板方法之间的多样性差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位主厨(即AI 模型),正试图根据一本食谱重现一道复杂而著名的菜肴(即目标分子)。你的任务是弄清楚需要购买哪些食材(即前体)来制作它。
通常,你的 AI 主厨已经阅读了数百万份食谱,非常擅长预测下一个食材。然而,它有一个习惯:即使你明确要求制作一道使用“辣辣椒”或“有机番茄”的菜肴,它也倾向于反复建议相同的流行食材。如果你只是让它“制作这道菜”,它可能会忽略你的具体要求,给你一个通用版本。
本文介绍了一种新方法,可以在不迫使主厨从头重新学习烹饪的情况下引导它。
问题所在:“通用”主厨
作者发现,标准的化学 AI 模型是在海量的反应数据集上训练的。因此,它们形成了一种强烈的“默认”思维方式。如果你试图引导它们进行特定类型的反应(例如“使用碳 - 碳偶联”)或使用特定的起始原料,标准 AI 往往会忽略你。
这就像一台已经记住了前往目的地最快路线的 GPS。如果你告诉 GPS“我想走风景优美的路线”,GPS 可能会无视你,继续指向高速公路,因为那是它被训练去做的。
失败的尝试:“交叉熵”教练
研究人员首先尝试使用标准的“教练”(一种通过交叉熵方法训练的分类器)来告诉主厨:“不,不是那个食材!选辣的那个!”
他们发现了一个根本缺陷:这位教练与主厨是在相同的数据上训练的。由于“辣辣椒”食谱在训练数据中很罕见,教练实际上并没有学会很好地区分它们。这就像聘请了一位只见过一张辣椒照片、其余全靠猜测的教练。当教练试图纠正主厨时,它的力量不足以克服主厨选择“安全”食材的强烈习惯。结果呢?主厨继续制作同样的通用菜肴。
解决方案:SCR(序列完成排序)
为了解决这个问题,作者发明了一种新的训练方法,称为序列完成排序(SCR)。
想象一种训练演练,教练不只是说“好”或“坏”。相反,教练制造了一个对比:
- 教练拿取主厨正在编写的部分食谱。
- 教练将最后一个食材替换为一个随机的、奇怪的食材(例如“牙膏”)。
- 教练随后迫使 AI 学习:“如果你想要辣味菜肴,‘辣辣椒’的得分必须显著高于‘牙膏’的得分,甚至高于主厨通常选择的‘安全’食材的得分。”
这就是基于边界的损失(Margin-Based Loss)。它就像一位严厉的评委,说道:“我不仅要求你正确;我要求你相对于错误选项明显正确。”通过以这种方式训练教练,它学会了即使在稀有食材的情况下,也能在“正确”路径和“错误”路径之间拉开巨大的差距。
实际运作方式
当 AI 主厨实际烹饪(逐步生成食谱)时:
- 主厨建议下一个食材。
- SCR 教练查看该建议并说:“如果你选这个,最终菜肴将是辣味的。如果你选那个其他的,就不会是。”
- 主厨听从教练的建议并调整其选择,有效地将食谱“引导”至用户的特定要求(如特定的反应类型或起始原料)。
结果:解锁新食谱
本文在巨大的化学反应数据集(USPTO-190)上测试了该方法。
- 无引导时:当被要求遵循特定约束时,AI 仅能解决约**17%**的复杂食谱。
- 使用 SCR 引导时:成功率跃升至78%(针对反应类型)和95%(针对起始原料)。
最重要的是,AI 找到了33 个目标的有效食谱,而没有任何其他方法能够解决这些目标。这就像一位此前只局限于几道喜爱菜肴的主厨,突然学会了烹饪 33 道以前无法想出的新复杂菜肴。
为何这很重要
- 无需重新训练:你不需要教主厨一门新语言。你只需在最后添加这位“教练”来引导选择。
- 化学家的偏好:它允许人类化学家说:“我需要一条使用廉价、安全起始原料的路线”或“我需要避免危险化学品”,而 AI 将真正听从并找到这些特定路径。
- 多样性:它阻止了 AI 仅仅重复相同的旧解决方案,从而开启了更广阔的化学可能性世界。
简而言之,本文教导 AI 如何在不忘却如何烹饪的情况下听取具体指令,方法是训练一位专门的教练,该教练确切知道如何在即使正确路径罕见的情况下,区分正确路径与错误路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。