← 最新论文
🤖 machine learning

Amortized Molecular Optimization via Group Relative Policy Optimization

本文介绍了 AMORTIX,这是一种摊销式图 Transformer 模型,它通过采用组相对策略优化来稳定训练以应对多样的结构约束和起始结构,从而实现了无需推理时调用预言机的高效单次分子优化。

原作者: Muhammad bin Javaid, Hasham Hussain, Ashima Khanna, Berke Kisin, Jonathan Pirnay, Alexander Mitsos, Dominik G. Grimm, Martin Grohe

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad bin Javaid, Hasham Hussain, Ashima Khanna, Berke Kisin, Jonathan Pirnay, Alexander Mitsos, Dominik G. Grimm, Martin Grohe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位主厨,试图创造一道完美的新菜肴。你有一种特定且不可协商的基础食材(例如某种特定类型的面条或独特的香料混合物),它必须保留在最终食谱中。你的目标是添加其他食材使其味道惊艳,但你必须通过实际烹饪和品尝来测试每一种组合。

在药物发现领域,这种“品尝”是由一个名为Oracle(神谕)的计算机程序完成的。运行它极其昂贵且缓慢。

旧方法:“试错”主厨(实例优化)

目前,大多数科学家使用一种称为实例优化(Instance Optimization)的方法。想象一下,对于你想要改进的每一个新基础食材,你都要雇佣一支新厨师团队。

  1. 他们从零开始。
  2. 他们烹饪数千种变体。
  3. 他们品尝所有变体(调用昂贵的 Oracle),以找到最佳方案。
  4. 一旦找到获胜者,他们就解散整个团队。
  5. 如果你有 1,000 种不同的基础食材,你就必须雇佣 1,000 支不同的团队,并为 1,000 次独立的昂贵品尝付费。

这虽然有效,但如果你有许多不同的起点,这种方法既缓慢又耗资巨大。

新方法:“超级学习者”主厨(摊销优化)

这篇论文介绍了AMORTIX,一种称为摊销优化(Amortized Optimization)的新方法。这就像雇佣一位天才主厨,让他去“烹饪学校”(训练)学习一段时间。

  1. 训练:主厨研究数千个示例,学习通用规则,例如“如果基础食材辛辣,就添加甜味”或“如果基础食材厚重,就添加轻盈元素”。
  2. 回报:一旦主厨训练完成,你可以将任何新基础食材交给他,他就能在一秒钟内瞬间设计出完美的菜肴。他不需要再次烹饪和品尝数千种选项;他只需运用所学。
  3. 优势:成本在训练期间预先支付。此后,创造新食谱几乎免费且瞬间完成。

大问题:“难与易”的谜题

作者发现之前的“超级学习者”主厨存在一个重大缺陷。

  • 有些基础食材容易改进(例如给寡淡的汤加盐)。几乎任何改变都能让它们变得更好。
  • 有些基础食材很难(例如试图让一块石头变得美味)。即使最好的改变也只能让它们略微改善。

如果你通过比较主厨的所有菜肴来训练他,那些“容易”的菜肴(很容易获得高分)会淹没“困难”的菜肴。主厨会想:“好吧,我做了一锅好汤,所以我做得很棒!”从而忽略了他未能改善石头的事实。由于难度差异巨大,学习信号变得混乱。

解决方案:组相对策略优化(GRPO)

AMORTIX 通过一种称为组相对策略优化(Group Relative Policy Optimization, GRPO)的巧妙技巧解决了这个问题。

系统不再直接将主厨的“易做汤”与“难做石”进行比较,而是将它们分入不同的组:

  • A 组(易做基础):主厨制作 10 种易做汤的变体。系统在它们之间进行比较。“这 10 种汤中哪一种最好?”
  • B 组(难做基础):主厨制作 10 种石头的变体。系统在它们之间进行比较。“这 10 种石头中哪一种最不那么糟糕?”

通过在相同的“难度组”内让主厨与其同行进行比较,系统能够针对简单和困难的任务都学到正确的经验,而不会感到困惑。

他们证明了什么?

作者在三种主要场景中测试了 AMORTIX:

  1. 标准测试(PMO 基准):他们与其他顶级方法玩了一场标准的“寻找最佳分子”游戏。AMORTIX 是最快且最高效的,在“超级学习者”方法中排名第一,总体排名第二。
  2. “新食材”测试(骨架修饰):他们向系统提供了从未见过的全新基础结构。AMORTIX 成功瞬间改进了它们,击败了其他必须为每个新基础重新烹饪数千次的方法。
  3. “少样本”测试(前药设计):他们向系统展示了四个将药物转化为“前药”(在体内激活的药物)的示例。系统学会了该规则,并成功将其应用于52 种完全不同的、从未见过的药物,瞬间生成了有效且可行的设计方案。

核心结论

AMORTIX 是一种新的人工智能工具,它通过一次性研究大量示例来学习设计药物,而不是为每个新问题从头开始。它利用一种聪明的分组技巧来处理简单和复杂的化学结构,使科学家能够瞬间生成优化的药物候选分子,而无需为每一个新的药物构想支付运行数千次计算机模拟的高昂成本。

注:论文明确指出,虽然人工智能设计了这些分子,但目前它仅适用于二维化学结构(平面绘图),尚未考虑对于现实世界药物结合至关重要的三维形状或立体化学。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →