想象一个计算机不仅能识别猫的照片或翻译语言,而且实际上能构思出新事物的世界。在人工智能领域,有一些被称为“生成模型”的特殊程序,它们扮演着数字炼金术士的角色。它们不是在烧瓶中混合化学物质,而是在一片广袤、无形的景观中混合数字,以创造新的分子——这些是药物、塑料和材料的微小构建模块。为了让这些模型发挥作用,科学家们给了它们一张地图:一个连续的坐标系,其中的每一个点都代表一个潜在的分子。人们希望,如果你在这张地图上走一小段距离,你会发现一个与起始分子化学性质相似的分子,就像从一辆红色的汽车移动到另一种略有不同的红色汽车一样。这种“可导航性”的概念至关重要;如果地图是平滑且逻辑清晰的,科学家就可以通过向正确的方向行走来寻找新药。但如果这张地图实际上是由无数尖锐、隐形的悬崖组成的拼布被褥呢?如果向前迈出一小步并没有让你得到一个相似的分子,而是突然让你掉入了一个完全不同的化学宇宙呢?这就是科学家们试图解决的谜题:这些人工智能模型究竟是如何在其数字大脑中组织它们所创造的分子的?
一组研究人员决定揭开三种不同分子人工智能模型的面纱,看看它们究竟是如何组织其创造物的。他们没有将人工智能内部的“地图”视为一条平滑流动的河流,而是将其视为一个由不同邻域划分的领地。通过冻结人工智能所做的随机选择,并精确追踪哪些坐标产生了哪些分子,他们发现这些模型创造的并不是一个平滑的化学梯度。相反,它们构建了一个“分段常数”区域的景观。可以把它想象成一个巨大的、多色的瓷砖地面。如果你站在一块瓷砖上,你会得到一个特定的分子。如果你迈出一小步,你可能会留在同一块瓷砖上,并得到完全相同的分子。但如果你跨过了瓷砖之间的隐形界线,即使你的步伐极其微小,你也会突然得到一个完全不同的分子。
研究人员发现,这种“瓷砖地图”并非随机生成的,它具有一定的结构。在某些模型中,比如自回归模型“MolMiner”和层级模型“HierVAE”,这些瓷砖像家族树一样组织在一起。你可能从代表一种通用化学骨架(如自行车架)的宽泛区域开始。随着你向该区域深处移动,边界会变得更加精细,将该区域分割成代表特定变体的更小瓷砖(如山地车对比公路车)。这是因为人工智能是循序渐进地构建分子的:早期的决策创造了宽泛的类别,而随后的决策则雕琢出细节。然而,这项研究也揭示了一个令人惊讶的转折:仅仅因为地图看起来很有组织,并不意味着地图上的距离就等于化学距离。在其中一个模型 HierVAE 中,计算机坐标网格中靠得很近的两个点,实际上可能会产生化学性质迥异的分子。计算机所看到的“距离”并不总是化学家所感受到的“距离”。
此外,团队观察了这些地图在人工智能学习过程中是如何变化的。他们发现,人工智能学会保持其邻域在化学上的一致性(留在同一个“化学家族”内)非常迅速。但是,在其邻域内能够产生的不同特定分子的数量,却会持续变化很长时间。这就像人工智能首先学会了把红车留在红色区域,把蓝车留在蓝色区域,然后才逐渐弄清楚它能制造出多少种红色。这项研究表明,在我们信任这些人工智能地图来帮助设计新的救命药物之前,我们需要检查我们所使用的地图的具体规则。我们不能仅仅假设在网格上走一小段距离总会导向一个化学性质相似的分子;有时,地图是充满尖锐边界的拼布,只有通过正确的视角去观察,它们才会产生意义。
技术摘要:分子生成模型如何组织分子身份
问题陈述
物质生成模型的评估通常基于其输出质量(有效性、新颖性、多样性),且其潜空间常被视为平滑且可导航的化学空间。然而,一个关键的结构性问题尚未得到解决:离散的分子身份是如何在这些模型的连续坐标空间内进行内部排列的?具体而言,目前尚不清楚分子身份是在何处被解析的,邻近的坐标是否解码为化学相关的分子,以及这种组织是如何在解码和训练过程中涌现的。目前的评估往往假设连续的潜空间意味着化学可导航空间,却未验证分子身份的内部划分。
方法论
作者提出了一个框架,将分子身份显式地定义为输出表示空间上的一个等价关系,并通过“拉回”(pull back)这些身份类来研究生成过程。
- 形式化定义: 研究通过输出空间 X(例如字符串、图)上的等价关系 (∼) 来定义分子身份。这创建了一个代表分子对象的商空间 X/∼。为了处理随机生成器,作者引入了一个“随机带” η,将生成过程视为从 (z,η) 到输出的一个确定性映射。这通过分子身份对联合空间 Z×E 进行了划分。
- 等价约定: 测试了六种不同的分子等价约定,涵盖从细粒度到粗粒度的范围:
- 规范异构体 SMILES(精确结构)。
- InChIKey-14(连接性,合并了立体异构体/互变异构体)。
- 分子式。
- 重原子元素。
- Bemis–Murcko 骨架。
- Murcko 通用骨架(仅骨架)。
- 研究的模型: 该框架应用于三种在 ZINC 数据集上训练的不同架构:
- MolMiner: 一种属性条件的自回归 Transformer。
- HierVAE: 一种具有自回归解码器的层次化图变分自编码器。
- GDSS: 一种基于评分的图扩散模型。
- 实验探测:
- 固定随机性截面: 在保持随机带 η 不变的情况下,探测 1D 和 2D 潜空间 Z 的截面,以可视化身份划分。
- 随机性持久性: 在固定 z 的情况下改变 η,以测试特定坐标是否始终解码为相同的分子。
- 邻域分析: 通过在 Z 中采样球体,测量化学凝聚力(即一个邻域内的分子相似性与跨邻域的相似性),使用基于 ECFP 和 MACCS 指纹的 Tanimoto 相似度。
- 度量相关性: 测试 Z 中的欧几里得距离或余弦相似度是否与化学相似度相关。
- 训练演化: 追踪这些属性在不同训练检查点(checkpoints)期间的发展。
核心贡献与结果
- 分段常数身份区域: 在所有三种架构中,固定随机带后均显示出潜空间被划分为由尖锐边界分隔的分段常数区域。这些区域对应于特定的分子身份。
- 对约定与架构的依赖性:
- MolMiner 和 HierVAE: 表现出极强的化学凝聚力。邻近的坐标解码为化学相关的分子,且不同的邻域占据不同的化学领地。这种组织在细粒度约定(SMILES, InChIKey-14)下依然成立。
- GDSS: 在随机解码下几乎没有精确分子身份的持久性(对于固定的 z,具有 99.95% 的唯一 SMILES)。只有在粗粒度约定(如 Murcko 骨架或元素组成)下才表现出清晰的组织,这表明其精确分子的变化主要由解码器的随机性而非坐标结构驱动。
- 度量局限性: 对于 HierVAE,虽然其潜空间具有化学组织性(邻近的点解码为相似的分子),但坐标间的欧几里得距离和余弦相似度是化学距离的劣质代理指标(R2≈0.05)。这表明潜空间是弯曲的,标准的几何度量并不能可靠地预测化学接近度。
- 由粗到细的边界: 划分呈现出反复出现的层次结构,其中宽泛的分子领地被更细的边界所细分。在 MolMiner 中,这归因于顺序解码过程:早期的解码步骤定义了宽泛的谱系(共享部分结构),随后的决策则细分了这些区域。
- 凝聚力与粒度的解耦: 在训练期间,化学凝聚力(一个邻域内的化学局部化程度)较早趋于稳定。相比之下,一个邻域内代表的独特分子身份数量(粒度)在凝聚力达到平台期后仍会继续演化和精细化。
意义与主张
本文认为,连续的生成坐标空间不足以建立一个化学可导航空间。在将潜空间视为可用于插值或优化的化学可导航空间之前,必须根据以下因素对其内部组织进行表征:
- 所生成的特定表示。
- 用于定义分子身份的等价约定。
- 随机解码过程。
- 用于比较坐标的度量标准。
作者得出结论,内部组织不是生成空间的一个单一、内在的属性,而是这些因素复杂相互作用的结果。该框架提供了一种直接的方法,用于确定一个生成空间是否具有组织性,以及它是否能针对特定的化学问题进行有意义的导航。作者指出,虽然本研究侧重于分子,但该框架适用于任何映射到具有意义等价关系的输出空间的生成模型,例如蛋白质或晶体。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。