← 最新论文
💻 computer science

BiMol-Diff: A Unified Diffusion Framework for Molecular Generation and Captioning

BiMol-Diff 是一个统一的扩散框架,它采用感知令牌的噪声调度来克服标准扩散模型和自回归模型的局限性,通过保留富含结构信息的子结构,在文本条件分子生成和分子描述生成任务中均实现了最先进的性能。

原作者: Aditya Hemant Shahane, Anuj Kumar Sirohi, Devansh Arora, Nitin Kumar, Prathosh A P, Sandeep Kumar

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Aditya Hemant Shahane, Anuj Kumar Sirohi, Devansh Arora, Nitin Kumar, Prathosh A P, Sandeep Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图同时教机器人两项截然不同的技能:

  1. 阅读化学蓝图并用通俗英语进行描述(就像为照片配说明文字)。
  2. 阅读文字描述(例如“一种能阻止癌细胞生长的分子”)并绘制出精确的化学蓝图。

长期以来,科学家们一直尝试使用“自回归”模型来教授这些技能。可以将这些模型想象成一个人从左到右逐个单词地写句子。如果他们在第一个词上犯错,整句话就可能偏离正轨,而且他们很难回头修正。此外,这些模型以相同的方式处理化学结构的每一部分,尽管某些部分(如分子的“骨架”)比其他部分更难准确生成。

本文介绍了一种名为BiMol-Diff的新方法,它利用扩散技术来训练机器人。

核心理念:“布满灰尘的草图”类比

想象你有一幅完美的分子绘图。

  • 标准扩散就像将这幅画扔进一桶灰尘中。灰尘均匀地洒在每一个角落。那些精细且重要的线条与空白区域被覆盖的程度完全相同。当机器人试图清除灰尘以重新看清绘图时,它显得力不从心,因为重要的线条被过多的灰尘掩埋了。
  • BiMol-Diff则更加聪明。它知道绘图中哪些部分是“关键线条”(即化学结构),哪些部分只是“背景噪声”。
    • 它在关键线条上撒较少的灰尘,使它们保持可见。
    • 它在容易的部分撒更多的灰尘
    • 当机器人清理绘图时,由于重要结构得到了保护,它可以轻松看清,从而完美地重建分子。

工作原理(双向通道)

作者构建了一个单一的“大脑”,能够执行任务的双向操作:

  1. 从分子到文本(描述生成): 机器人观察化学结构,识别出“受保护”的部分,并写出清晰的描述。
  2. 从文本到分子(生成): 机器人阅读描述,推断出需要保护的“困难”化学部分,并绘制出分子。

为了实现这一点,他们并未仅使用标准的化学文本格式(SMILES)。相反,他们将分子分解为一种特定格式:原子 - 键 - 原子三元组。想象将分子拆解,并以类似食谱的方式列出每一个连接:“碳连接氧,氧连接氢”。这有助于机器人比仅靠一串字母更好地理解分子的形状。

关键秘诀:“令牌感知噪声”

最大的创新在于他们如何处理“灰尘”(噪声)。

  • 旧方法: “我将同等程度地破坏分子的每一部分。”
  • BiMol-Diff 方法: “我将审视分子的每一部分。如果某部分难以猜测(例如复杂的环状结构),我会保持其非常干净。如果某部分容易猜测,我可以更多地破坏它。”

这就像老师在批改试卷。如果学生在某个特定的数学概念上遇到困难,老师会针对该特定部分给予额外练习,而不是在所有内容上给予同等数量的练习。

结果:它奏效了吗?

团队在两个大型数据集(分子及其描述的集合)上测试了该方法。

  • 在描述分子方面: BiMol-Diff 撰写的说明文字优于任何先前的模型。它更加准确,并使用了更丰富的词汇。
  • 在绘制分子方面: 这正是它大放异彩的地方。当被要求根据描述绘制分子时,其结构正确的概率比最佳先前方法高出15.4%。此外,它生成的分子在化学上是有效的(在现实世界中真实存在),并且与目标分子非常相似。

权衡(局限性)

该论文诚实地指出了一个缺点:速度
由于机器人必须逐步(迭代地)“清理”绘图,因此其耗时比“逐个单词书写”的模型更长。

  • 如果你需要即时结果(低延迟),旧模型仍然更快。
  • 如果你需要高质量和高精度(例如在药物发现中,形状错误会导致严重后果),BiMol-Diff 则是赢家。

总结

BiMol-Diff 是一个统一系统,它将化学结构与语言视为同一枚硬币的两面。通过“智能”地处理数据的破坏与清理——保护困难且重要的化学部分,同时允许容易的部分变得混乱——它在文本与分子设计之间建立了一个更加可靠的桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →