想象你是一位主厨,试图改进一道名汤的食谱。你想让它味道更好(进行优化),但不能完全改变食谱;它仍需保持原汤的风味(维持相似性)。
大多数最近的 AI 方法试图通过向一个巨型语言模型提问来实现这一点:“这是一碗汤,让它变得更美味。”随后,AI 会尝试根据这一模糊指令从头重写整个食谱。该论文指出,这种方法存在两个主要缺陷:
- 指令模糊:在现实科学中,“味道”(即目标)往往是一个黑盒。你无法用语言完美描述它(例如,“让它结合到这种特定蛋白质上”)。AI 会感到困惑,因为文字与现实不匹配。
- 上下文至关重要:一种特定食材(例如一小撮盐)可能让一碗汤变得美味,却毁掉另一碗汤。将食材视为孤立事实的 AI 模型忽略了这一至关重要的上下文。
此时,FORGE(面向片段的排序与生成)登场了。它不像重写整碗汤,而是像一位外科主厨,确切知道要替换哪一小块以及替换成什么。
以下是 FORGE 的工作原理,分解为简单步骤:
1. “原子”词汇表(稳定的食材)
标准 AI 模型像阅读文本一样读取化学式,其中同一种食材可能会因句子不同而拼写不同。FORGE 使用一种特殊的“原子”词汇表。你可以将其理解为给每一个原子和化学基团颁发一张独一无二、不可更改的身份证。无论它出现在哪碗汤中,“盐”始终被识别为“盐”。这防止了 AI 对实际观察对象产生混淆。
2. 第一阶段:“何处”(排序薄弱环节)
在做出更改之前,FORGE 会审视整碗汤并问道:“目前是哪一种特定食材拖累了风味?”
- 旧方法:AI 基于通用规则进行猜测。
- FORGE 的方法:它审视整个上下文。它知道某种香料之所以不好,仅仅是因为锅中当前的其他食材。它会对食材进行排序,找出需要修复的“最薄弱环节”。
3. 第二阶段:“如何”(外科式替换)
一旦找到薄弱环节,FORGE 不会重写整个食谱。它会执行精确的替换:“取出这种特定香料,用这种特定草药替换它。”
- 它通过查看化学数据库中数百万个“前后对比”示例来学习这一过程(就像一个成功的食谱调整图书馆)。
- 关键在于,它学到最佳替换方案取决于当前汤的具体上下文,而不仅仅是通用规则。
4. 通过示例学习(“展示而非讲述”的方法)
当 FORGE 面对一个从未见过的全新目标(例如针对一种新的、未知的蛋白质进行优化)时,它不依赖文字描述。相反,它使用上下文学习。
- 想象你在玩一款电子游戏,面对一个全新的、未知的 Boss。你不是阅读手册,而是观看一位职业玩家击败类似 Boss 的录像回放。
- FORGE 维护着一个自身过往尝试的“回放缓冲区”。它会查看几个“分子 A 被调整为分子 B,得分随之提升”的示例。它利用这些示例来推断如何调整当前分子,而无需在文字层面理解目标背后的复杂科学原理。
为何它能胜出
该论文将 FORGE 与更大、更强大的 AI 模型进行了测试(其中一些拥有 80 亿参数,而 FORGE 仅使用 6 亿参数)。
- 结果:FORGE consistently 击败了这些巨头。
- 原因:这些巨头试图根据模糊的文字提示“幻觉”出一个完美的新分子。FORGE 之所以成功,是因为它专注于利用稳定词汇表进行小型、感知上下文的编辑。它将分子优化视为一系列精确的局部修复,而非创意写作练习。
总结:FORGE 是一个微小且高效的 AI,它不试图重写整个故事。相反,它找出需要修复的那一个句子,理解段落的上下文,并替换进完美的词语,通过过往示例而非模糊指令进行学习。
技术摘要:FORGE(面向片段的排序与生成)
1. 问题陈述
分子优化旨在通过对起始分子进行微小的结构编辑来改善其性质,同时保持与原始化合物的高度相似性。当前最先进的方法通常将其表述为利用大语言模型(LLM)进行的提示条件序列生成任务。作者认为,这种表述方式在根本上与问题的局部编辑特性不相符,原因有二:
- 语义不匹配:现实世界的药物发现目标(例如专有的结合评分、ADMET 分类器)往往缺乏忠实的自然语言描述。依赖文本提示会导致控制力薄弱,而在 LLM 蒸馏的思维链数据上进行训练,往往会继承化学上的不准确或幻觉。
- 忽视上下文依赖性:分子片段对性质的贡献强烈依赖于其局部化学环境。将片段贡献视为全局的、无上下文的标量,会破坏关键的结构性信息并引入标签噪声。
2. 方法论:FORGE 框架
FORGE(面向片段的排序与生成)将分子优化重新表述为感知上下文的局部编辑。它将任务分解为两个明确的决策:在哪里编辑和如何编辑。该框架基于一个紧凑的 0.6B 语言模型(Qwen3-0.6B)构建,并在两个监督阶段运行,随后采用一种针对黑盒目标调整的推理机制。
核心组件
- 原子级分词(QwenAtom):为了确保片段身份在不同宿主分子中保持一致,作者使用基于正则表达式的原子解析器替代标准的字节对编码(BPE)来处理 SMILES 字符串。这确保了相同的化学子结构无论周围分子如何,都能被一致地分词,这是实现可靠片段级监督的前提。
- 阶段 1:感知上下文的片段排序(判别式):
- 目标:确定在哪里编辑。
- 机制:模型根据片段在完整分子上下文中对目标性质的贡献对其进行排序。
- 监督:使用基于规则的数据(RDKit 用于 QED、logP 等性质)和基于图神经网络(GNN)的归因(SME)用于 hERG 和 ESOL 等性质。关键在于采用SME+,这是子结构掩码解释(Substructure Mask Explanation)的上下文条件扩展,它根据片段的局部 ECFP 环境(半径 r=2)对片段出现进行分组,而不是进行全局聚合。
- 任务:分解、排序、脆弱性预测和上下文学习(ICL)排序。
- 阶段 2:显式片段替换(生成式):
- 目标:确定如何编辑。
- 机制:为识别出的弱片段生成显式的替换方案。
- 监督:基于经过验证的低分至高分编辑对进行训练,这些编辑对源自:
- SME+:在特定环境分箱内提高分数的上下文特定替换。
- ChEMBL 匹配分子对(MMPs):共享骨架但仅在一个片段上不同的真实世界分子对,经过过滤以排除基准目标(DRD2、JNK3、GSK3-β),防止数据泄露。
- 输出格式:显式修改语法(例如
frag_src >> frag_tgt),而非全分子重写。
- 推理:针对黑盒目标的上下文学习(ICL):
- FORGE 无需梯度更新即可适应未见过的、未命名的黑盒目标。
- 它维护一个包含(源分子、修改、结果分子、Oracle 评分)元组的回放缓冲区。
- 在搜索过程中,模型从该缓冲区(偏向高分)中采样演示作为提示,以推断目标目标并提出编辑建议。
3. 主要贡献
- 数据策略:证明了上下文条件化、经规则验证的片段编辑是一种可行、可扩展且无幻觉的替代方案,可替代自然语言目标或昂贵的 LLM 蒸馏思维链数据。
- 框架设计:提出了 FORGE,这是一个两阶段框架,将优化解耦为上下文条件排序(在哪里)和显式替换生成(如何),并利用原子级分词来稳定片段身份。
- 性能效率:表明使用该框架的 0.6B 模型取得了最先进(SOTA)的结果,在多个基准测试中显著优于更大的模型(8B+ LLM、GPT-4o)和基于图的方法。
4. 实验结果
作者在五个基准测试中评估了 FORGE:
- Prompt-MolOpt(相似性约束的 ADMET):FORGE 始终优于基线,且随着相似性约束的收紧(δ=0.6),性能差距进一步扩大。在 δ=0.6 时,FORGE 的 SUM 得分为 2.882,而原始 Prompt-MolOpt 为 0.824,这证明了在严格约束下,局部片段编辑优于全 SMILES 重写。
- PMO-1k(黑盒优化):在 22 个未命名的黑盒任务中,受限于 1,000 次调用预算,FORGE 实现了 12.42 的总分,优于 LICO(11.71)和其他无梯度方法。
- QED-DRD2(显式修改):在比较输出格式时,FORGE 的显式修改变体比端到端生成变体高出 3–5 个百分点,特别是在严格相似性阈值下。
- 先导化合物优化(真实靶标对接):在五个蛋白质靶标的对接任务中,FORGE 在 30 种配置中取得了 20 种最佳对接评分,显著优于 Graph GA 和 GenMol,特别是在严格相似性约束下。
- ChemCoTBench(小模型与大模型对比):0.6B 的 FORGE 模型在六个优化任务中匹配或超过了 Qwen-3-8B(SFT)和 GPT-4o 的性能。值得注意的是,在真实靶标任务(DRD2、JNK3、GSK3-β)中,FORGE 的成功率达到 86–94%,而 8B 和 GPT-4o 基线的成功率仅在 20–48% 之间挣扎。
5. 意义与主张
该论文声称,FORGE 的主要价值在于将范式从自然语言条件化转变为显式的片段级监督。
- 上下文为王:作者提供了实证证据,表明片段效应具有高度的上下文依赖性;通过 SME+ 将片段归因基于局部环境进行条件化,可将方差降低 8–10%,这对于相似性约束下的性能至关重要。
- 提示的局限性:实验表明,在提示中更改黑盒目标的自然语言描述对优化行为的影响微乎其微(<3% 的分数变化),这表明自然语言是这些任务的弱控制信号。
- 可扩展性:该框架证明,当训练数据和输出格式与化学问题的结构本质(局部编辑而非全局生成)相一致时,一个小型的专用模型(0.6B)可以超越庞大的通用模型。
作者得出结论,显式的片段级监督是分子优化中比自然语言训练更易于获取、可扩展且可靠的替代方案,特别是在处理黑盒目标和严格结构约束时。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。