APOSM: Pairwise preference learning improves generative small-molecule design
本文介绍了 APOSM,这是一个主动学习框架,通过在分子对比较而非绝对评分之上训练图神经网络代理模型,增强了小分子设计,从而在噪声筛选机制中显著提高了目标达成率和采样效率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在发现新药的竞赛中,科学家们面临着一个几乎令人感到不可能完成的规模问题。小分子(即可能成为药物的微小化学结构)的宇宙如此浩瀚,其中包含的候选者比银河系中的恒星还要多。没有任何实验室,无论其资金多么雄厚,都无法合成并测试其中的每一个。因此,研究人员必须依靠计算机模型来充当过滤器,预测哪些分子值得投入昂贵且耗时的实验室测试工作。几十年来,这些计算机模型一直试图为每个分子分配一个特定的分数,以估算其针对某种疾病的效果究竟有多好。然而,当数据稀缺或存在噪声时,这些预测往往会失灵,导致资源浪费在那些在理论上看起来不错但在试管实验中失败的化合物上。核心挑战在于,如何找到一种可靠的信号来引导这场在化学荒野中的搜索,即使在地图不完整的情况下也能让人信赖。
哥本哈根大学的一个研究小组提出了一种导航这一空间的不同方法,将重点从猜测精确分数转向了进行简单的比较。他们的新方法被称为 APOSM,它不将寻找更好的药物视为一场命中特定目标数字的游戏,而将其视为一系列一对一的对决。该系统不再要求计算机预测单个分子的精确活性,而是提出了一个更简单的问题:给定两个候选者,哪一个可能更好?这种方法借鉴了一个对于任何曾经进行过物品排序的人来说都很熟悉的概念,但将其应用于复杂的分子设计领域。通过训练计算机从这些相对偏好中学习,研究人员发现他们可以建立一个更可靠的指南来发现新药,特别是在数据有限且难以解释的情况下。
研究人员围绕一个主动学习循环构建了他们的系统,这个过程模仿了科学家迭代完善假设的方式。它始于一组已知的少量分子,以及一个通过进行细微且符合化学逻辑的变化(例如将结构的一部分替换为不同的片段)来创建新变体的生成器。这些新的候选者随后被输入到一个“代理”模型中,这是一种旨在模拟实验室实验结果的人工智能类型。在这个系统中,代理模型并不孤立地观察分子。相反,它观察分子对,并学习根据之前的实验数据预测实验室会更倾向于哪一个。这种偏好信号随后被用于对所有新候选者进行排名,排名靠前的候选者会被选中进行虚拟或真实的实验室测试。这些测试的结果会被反馈到系统中,使代理模型能够在下一轮中学习并提高其排名能力。
为了测试这种方法是否真的有效,团队将其置于两个不同的挑战之中。第一个任务涉及多巴胺受体,这是治疗帕金森病等疾病的常见靶点。计算机被给予一个包含 300 个已知分子的初始列表,并被要求寻找与某个特定的、隐藏的目标在结构上相似的新分子。在这种场景下,这种新方法优于旧方法。当其他算法在化学景观中漫无目的地游荡,甚至经常误入潜力较低的区域时,这种基于偏好的引导系统则保持专注,停留在高价值区域。它始终能找到更好的候选者,并且能以更少的尝试达到更高的分数,证明了相对比较策略即使在起始信息有限的情况下,也能有效地引导向目标。
第二个挑战更为严格,使用了被称为“实用分子优化”(Practical Molecular Optimization)的标准基准测试,其中包括 25 个不同的任务,范围从寻找具有特定形状的分子到同时优化多种属性。在这些测试中,系统通常仅从单个分子开始,并且面临着虚拟实验次数的严格限制。在这里,基于偏好的方法的优势变得更加清晰。研究人员将他们的法与一个试图预测精确分数的方法以及一个模仿自然进化的标准遗传算法进行了对比。这种基于偏好的引导系统表现优于两者,尤其是在预测精确分数极其困难的任务中。它不仅找到了更好的分子,还产生了一组看起来更像现实世界数据库中高质量、类药化合物的候选者,这表明它正在学习正确的化学直觉。
这项研究的一个关键部分是确定为什么这种方法如此有效。研究人员进行了一项特定的检查,以确定这种改进是来自于计算机的学习方式,还是来自于它生成新分子的方式。他们发现,关键在于学习方法本身。当他们将基于偏好的学习器替换为一个试图预测精确分数的学习器时,性能下降了。这证实了在药物发现这种混乱且数据匮乏的环境中,让计算机学习两个选项中哪一个更好,比让它猜测单个选项的精确值要更容易且更可靠。该系统本质上学会了信任相对信号,从而忽略了经常困扰绝对预测的噪声。
这项工作代表了我们在利用人工智能设计药物方面迈出的重要一步。通过将新分子的生成与评分机制解耦,并专注于成对比较,研究人员创建了一个灵活且稳健的框架。它不需要庞大的数据集即可启动,并能随着新数据的加入而进行调整。研究结果表明,对于药物研发中困难的现实问题——即科学家必须改进一个有前景但尚不完美的候选药物(即先导化合物优化)——比较学习比试图用绝对确定性来预测未来提供了一条更可靠的路径。随着该领域向更复杂的设计挑战迈进,这种方法提供了一种原则性的方式,将带有噪声且稀疏的实验数据转化为清晰的发现指南,确保以更高的效率和更大的信心发现下一代药物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。