← 最新论文
🤖 machine learning

How Molecular Generative Models Organize Molecular Identity

本文揭示了分子生成模型将化学身份组织成具有循环边界的固定分段常数区域,这表明在可以可靠地利用潜在空间进行化学导航之前,必须对其内部结构进行经验性表征,而非预先假设。

原作者: Raul Ortega-Ochoa, Tejs Vegge, Jens S. Bakander, Luis Mantilla Calderon, Alan Aspuru-Guzik, Tonio Buonassisi

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Raul Ortega-Ochoa, Tejs Vegge, Jens S. Bakander, Luis Mantilla Calderon, Alan Aspuru-Guzik, Tonio Buonassisi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅能识别猫的照片或翻译语言,而且实际上能构思出新事物的世界。在人工智能领域,有一些被称为“生成模型”的特殊程序,它们扮演着数字炼金术士的角色。它们不是在烧瓶中混合化学物质,而是在一片广袤、无形的景观中混合数字,以创造新的分子——这些是药物、塑料和材料的微小构建模块。为了让这些模型发挥作用,科学家们给了它们一张地图:一个连续的坐标系,其中的每一个点都代表一个潜在的分子。人们希望,如果你在这张地图上走一小段距离,你会发现一个与起始分子化学性质相似的分子,就像从一辆红色的汽车移动到另一种略有不同的红色汽车一样。这种“可导航性”的概念至关重要;如果地图是平滑且逻辑清晰的,科学家就可以通过向正确的方向行走来寻找新药。但如果这张地图实际上是由无数尖锐、隐形的悬崖组成的拼布被褥呢?如果向前迈出一小步并没有让你得到一个相似的分子,而是突然让你掉入了一个完全不同的化学宇宙呢?这就是科学家们试图解决的谜题:这些人工智能模型究竟是如何在其数字大脑中组织它们所创造的分子的?

一组研究人员决定揭开三种不同分子人工智能模型的面纱,看看它们究竟是如何组织其创造物的。他们没有将人工智能内部的“地图”视为一条平滑流动的河流,而是将其视为一个由不同邻域划分的领地。通过冻结人工智能所做的随机选择,并精确追踪哪些坐标产生了哪些分子,他们发现这些模型创造的并不是一个平滑的化学梯度。相反,它们构建了一个“分段常数”区域的景观。可以把它想象成一个巨大的、多色的瓷砖地面。如果你站在一块瓷砖上,你会得到一个特定的分子。如果你迈出一小步,你可能会留在同一块瓷砖上,并得到完全相同的分子。但如果你跨过了瓷砖之间的隐形界线,即使你的步伐极其微小,你也会突然得到一个完全不同的分子。

研究人员发现,这种“瓷砖地图”并非随机生成的,它具有一定的结构。在某些模型中,比如自回归模型“MolMiner”和层级模型“HierVAE”,这些瓷砖像家族树一样组织在一起。你可能从代表一种通用化学骨架(如自行车架)的宽泛区域开始。随着你向该区域深处移动,边界会变得更加精细,将该区域分割成代表特定变体的更小瓷砖(如山地车对比公路车)。这是因为人工智能是循序渐进地构建分子的:早期的决策创造了宽泛的类别,而随后的决策则雕琢出细节。然而,这项研究也揭示了一个令人惊讶的转折:仅仅因为地图看起来很有组织,并不意味着地图上的距离就等于化学距离。在其中一个模型 HierVAE 中,计算机坐标网格中靠得很近的两个点,实际上可能会产生化学性质迥异的分子。计算机所看到的“距离”并不总是化学家所感受到的“距离”。

此外,团队观察了这些地图在人工智能学习过程中是如何变化的。他们发现,人工智能学会保持其邻域在化学上的一致性(留在同一个“化学家族”内)非常迅速。但是,在其邻域内能够产生的不同特定分子的数量,却会持续变化很长时间。这就像人工智能首先学会了把红车留在红色区域,把蓝车留在蓝色区域,然后才逐渐弄清楚它能制造出多少种红色。这项研究表明,在我们信任这些人工智能地图来帮助设计新的救命药物之前,我们需要检查我们所使用的地图的具体规则。我们不能仅仅假设在网格上走一小段距离总会导向一个化学性质相似的分子;有时,地图是充满尖锐边界的拼布,只有通过正确的视角去观察,它们才会产生意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →