想象一下,你正试图同时教机器人两项截然不同的技能:
- 阅读化学蓝图并用通俗英语进行描述(就像为照片配说明文字)。
- 阅读文字描述(例如“一种能阻止癌细胞生长的分子”)并绘制出精确的化学蓝图。
长期以来,科学家们一直尝试使用“自回归”模型来教授这些技能。可以将这些模型想象成一个人从左到右逐个单词地写句子。如果他们在第一个词上犯错,整句话就可能偏离正轨,而且他们很难回头修正。此外,这些模型以相同的方式处理化学结构的每一部分,尽管某些部分(如分子的“骨架”)比其他部分更难准确生成。
本文介绍了一种名为BiMol-Diff的新方法,它利用扩散技术来训练机器人。
核心理念:“布满灰尘的草图”类比
想象你有一幅完美的分子绘图。
- 标准扩散就像将这幅画扔进一桶灰尘中。灰尘均匀地洒在每一个角落。那些精细且重要的线条与空白区域被覆盖的程度完全相同。当机器人试图清除灰尘以重新看清绘图时,它显得力不从心,因为重要的线条被过多的灰尘掩埋了。
- BiMol-Diff则更加聪明。它知道绘图中哪些部分是“关键线条”(即化学结构),哪些部分只是“背景噪声”。
- 它在关键线条上撒较少的灰尘,使它们保持可见。
- 它在容易的部分撒更多的灰尘。
- 当机器人清理绘图时,由于重要结构得到了保护,它可以轻松看清,从而完美地重建分子。
工作原理(双向通道)
作者构建了一个单一的“大脑”,能够执行任务的双向操作:
- 从分子到文本(描述生成): 机器人观察化学结构,识别出“受保护”的部分,并写出清晰的描述。
- 从文本到分子(生成): 机器人阅读描述,推断出需要保护的“困难”化学部分,并绘制出分子。
为了实现这一点,他们并未仅使用标准的化学文本格式(SMILES)。相反,他们将分子分解为一种特定格式:原子 - 键 - 原子三元组。想象将分子拆解,并以类似食谱的方式列出每一个连接:“碳连接氧,氧连接氢”。这有助于机器人比仅靠一串字母更好地理解分子的形状。
关键秘诀:“令牌感知噪声”
最大的创新在于他们如何处理“灰尘”(噪声)。
- 旧方法: “我将同等程度地破坏分子的每一部分。”
- BiMol-Diff 方法: “我将审视分子的每一部分。如果某部分难以猜测(例如复杂的环状结构),我会保持其非常干净。如果某部分容易猜测,我可以更多地破坏它。”
这就像老师在批改试卷。如果学生在某个特定的数学概念上遇到困难,老师会针对该特定部分给予额外练习,而不是在所有内容上给予同等数量的练习。
结果:它奏效了吗?
团队在两个大型数据集(分子及其描述的集合)上测试了该方法。
- 在描述分子方面: BiMol-Diff 撰写的说明文字优于任何先前的模型。它更加准确,并使用了更丰富的词汇。
- 在绘制分子方面: 这正是它大放异彩的地方。当被要求根据描述绘制分子时,其结构正确的概率比最佳先前方法高出15.4%。此外,它生成的分子在化学上是有效的(在现实世界中真实存在),并且与目标分子非常相似。
权衡(局限性)
该论文诚实地指出了一个缺点:速度。
由于机器人必须逐步(迭代地)“清理”绘图,因此其耗时比“逐个单词书写”的模型更长。
- 如果你需要即时结果(低延迟),旧模型仍然更快。
- 如果你需要高质量和高精度(例如在药物发现中,形状错误会导致严重后果),BiMol-Diff 则是赢家。
总结
BiMol-Diff 是一个统一系统,它将化学结构与语言视为同一枚硬币的两面。通过“智能”地处理数据的破坏与清理——保护困难且重要的化学部分,同时允许容易的部分变得混乱——它在文本与分子设计之间建立了一个更加可靠的桥梁。
以下是论文《BiMol-Diff:用于分子生成与描述的统一扩散框架》的详细技术总结。
1. 问题陈述
本文解决了连接分子结构(原子与键的图)与自然语言描述的挑战。这种双向能力对于可控分子设计至关重要:
- 分子生成(文本 → 分子): 将自然语言描述(例如,“一种具有良好溶解性的激酶抑制剂”)转换为有效的分子结构。
- 分子描述(分子 → 文本): 生成解释分子结构和性质的自然语言描述。
现有方法的局限性:
- 自回归(AR)模型: 虽然流行(例如 GPT、T5),但它们按顺序(从左到右)生成令牌。这使它们容易受到误差传播的影响,难以处理长距离依赖(例如 SMILES 中的环闭合),且难以轻松强制执行全局结构有效性。
- 标准扩散模型: 虽然非自回归且能够进行整体更新,但标准扩散对所有令牌应用均匀噪声。这对化学而言并非最优,因为它对化学关键令牌(例如环索引、分支标记)的破坏程度与对冗余令牌的破坏程度一样剧烈,阻碍了有效结构的恢复。
2. 方法论:BiMol-Diff
BiMol-Diff 是一个统一的扩散框架,在单一的条件去噪公式下处理生成和描述任务。
A. 表示流程
该框架不将分子纯粹视为字符级字符串,而是采用结构化方法:
- 规范 SMILES: 作为标准接口。
- SMILES 中的原子(AIS): 将 SMILES 转换为化学感知的令牌序列。
- 序列化图三元组(G~): 对于基于图的建模,分子被表示为使用特殊令牌(
[HEAD]、[REL]、[TAIL]、[SEP])的原子 - 键 - 原子三元组序列。
- 示例: C1 和 C2 之间的键被序列化为
[HEAD] C1 [REL] SINGLE [TAIL] C2。
- 这使得模型能够将分子视为序列化的知识图谱(KG),减少了对特定 SMILES 语法规则的依赖。
B. 核心创新:令牌感知噪声调度
核心贡献是一种令牌感知噪声调度,它根据恢复特定令牌的难度来调整破坏过程。
- 原理: 化学显著令牌(高信息密度)比语法或冗余令牌更难恢复。均匀噪声过早地破坏了这些关键令牌。
- 机制:
- 难度估计: 在训练期间,模型估计每个时间步的每令牌重建损失(ℓti)。高损失表明是“困难”令牌。
- 自适应调度: 映射函数(具体为分段线性映射)将难度概况转换为每个令牌 i 的自定义噪声调度(αˉt,newi)。
- 结果: 难以去噪的令牌接收更保守的破坏调度(早期添加的噪声较少),在正向过程中保持其完整性,并在反向过程中提高可恢复性。
C. 统一训练目标
该框架使用源自变分下界(VLB)的目标,并采用z0 预测重参数化。模型被训练为直接预测干净数据(z0),而不仅仅是噪声。损失函数结合了:
- 去噪: 跨时间步预测干净数据。
- 一致性: 确保第一步去噪与真实数据嵌入对齐。
- 舍入: 一个特定项,用于处理从连续潜在空间转换回离散令牌(SMILES 或文本)的过程。
3. 主要贡献
- 令牌感知加噪策略: 一种新颖机制,根据令牌恢复难度分配位置相关的噪声水平,从而保护化学关键子结构。
- 统一双向框架: 单个模型架构能够使用相同的令牌感知机制执行文本到分子(S2G)和分子到文本(G2S)任务。
- 序列化图表示: 使用原子 - 键 - 原子三元组允许更好的泛化,并减少了对刚性 SMILES 语法的依赖,优于纯字符级模型。
4. 实验结果
该模型在两个数据集上进行了评估:ChEBI-20(分子生成)和 M3-20M(分子描述)。
M3-20M 上的分子描述(G2S)
- 性能: BiMol-Diff 取得了最先进(SOTA)的结果,在 BLEU 上比最佳自回归基线(Text+Chem T5)高出 4.6%,在 ChrF++ 上高出 4.7%。
- 指标: 它在所有基线中也取得了最佳的 BERTScore(0.843)和 MAUVE(0.925)。
- 效率: 尽管是扩散模型,但其速度比 DiffuSeq 基线快 3.6 倍,同时保持了更高的质量。
ChEBI-20 上的分子生成(S2G)
- 重建: BiMol-Diff 实现了 0.262 的精确匹配准确率,比最佳自回归和扩散基线(均为 0.227)提高了 15.4%(相对提升)。
- 结构保真度: 指纹相似度显著提升(MACCS: 0.894, Morgan: 0.762),表明更好地保留了化学子结构。
- 有效性: 保持了高化学有效性(0.901),确保生成的分子在化学上是合理的。
消融研究
- 噪声调度: 用令牌感知调度替换均匀的"sqrt"调度带来了显著增益(例如,BLEU 从 0.495 增加到 0.567)。
- 分词: SMILES 中的原子(AIS) 分词器优于基于正则表达式和原子级的分词器,证实了化学感知分割的优势。
5. 意义与结论
- 科学影响: BiMol-Diff 证明了令牌感知去噪对于高保真分子语言建模至关重要。通过在扩散过程中显式保护化学重要令牌,该模型克服了化学生成人工智能中常见的结构脆弱性。
- 统一方法: 它证明单一扩散框架可以有效地处理生成和描述任务,促进了迭代设计循环中的一致性。
- 权衡: 虽然扩散模型通常比自回归模型产生更高的推理成本,但 BiMol-Diff 表明,通过优化采样(例如 1000–2000 步),它可以在质量上超越 AR 模型,同时在速度上保持竞争力。然而,对于超低延迟应用,AR 模型仍然更优。
总之,BiMol-Diff 代表了可控分子设计的重要进步,提供了一种稳健、统一且具备结构感知能力的替代方案,以取代传统的自回归方法。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。