✨ 要点🔬 技术摘要
想象一下你是一位试图设计一栋新房子的建筑师。你面临着两个截然不同的目标:
外观: 这栋房子必须完美地融入一个特定的、现有的社区。它需要契合街道的形状,并具备特定的特征(比如门廊或凸窗)以融入邻里环境。
建造: 这栋房子必须使用当地五金店实际能买到的材料和方法来建造。你不能设计出一栋需要“飞行的砖头”或“液体墙”的房子,因为没人知道如何制造这些东西。
通常,用于设计分子(药物的微小构建单元)的计算机程序擅长其中之一,但对另一项则表现得很差。它们可能会设计出完美契合“社区”(疾病靶点)的分子,但这种分子在实验室里根本无法合成。或者,它们可能设计出了易于建造的东西,但却完全不符合目标要求。
SynLaD 是一个全新的计算机程序,它通过扮演一位能流利切换“设计”与“施工”两种语言的大师级建筑师来解决这个问题。
两阶段过程
论文将 SynLaD 描述为一个两阶段的过程,我们可以将其视为学习蓝图 ,然后绘制新蓝图 。
第一阶段:学习蓝图(自动编码器)
首先,计算机研究数千个科学家已经成功建造的现有分子。它学习了一种特殊的“秘密语言”(称为潜空间 )。
把这种秘密语言想象成一个压缩的 zip 文件。在这个 zip 文件内部,计算机同时存储了两样东西:
3D 形状: 分子在空间中的样子(就像房子的 3D 模型)。
配方: 从零开始建造它的逐步指令(就像一份施工手册)。
计算机进行训练,使得如果你给它一个特定的 zip 文件,它可以解压并同时展示出3D 形状 和施工配方 。至关重要的一点是,它学习到这两者必须是匹配的。你不能有一个砖房的配方,解压出来的却是玻璃摩天大楼。
第二阶段:绘制新蓝图(扩散模型)
一旦计算机理解了这种秘密语言,它就开始进入一个新的阶段,称为扩散 。
想象一位雕塑家从一块充满噪声、带有静电感的粘土开始。雕塑家慢慢地去除噪声,精炼形状,直到一个清晰的雕像显现出来。
在 SynLaD 中,计算机从“秘密语言”空间中的随机噪声开始。然后,它使用一个 药效团轮廓(Pharmacophore Profile) 作为引导。
什么是药效团? 把它想象成一把“磁性钥匙”。它是一张地图,标明了药物需要抓取疾病诱发蛋白的具体位置(就像钥匙需要特定的凹槽才能转动锁芯)。
计算机缓慢地精炼噪声,塑造这个“zip 文件”,直到它与这把“磁性钥匙”相匹配。
最后,它解压该文件。由于在第一阶段接受了训练,它会立即生成:
一个能完美契合“磁性钥匙”的新 3D 分子。
一个关于如何在实验室中建造该精确分子的有效、逐步进行的配方。
为什么这意义重大
作者声称,以往的方法就像是在先猜出形状之后,再寄希望于承包商稍后能造出它。如果承包商说:“我造不出那个”,那么整个设计就白费了。
SynLaD 则不同,它在设计房子的同时也设计了施工计划。
“双头”技巧: 计算机有两个“头”(或大脑)在协同工作。一个头专注于 3D 形状,另一个头专注于化学配方。它们不断地互相检查。如果配方头说:“这个形状无法建造”,形状头就会调整设计。
没有“魔法成分”: 与其他依赖固定预设化学反应清单(比如只有一个 10 项菜单的菜单)的方法不同,SynLaD 学习的是化学的原理 。这使得它能够发明不在标准菜单上的、新的且有效的配方,从而赋予它探索新设计的更多自由。
结果
作者通过要求 SynLaD 设计针对已知疾病靶点的新分子(使用“磁性钥匙”方法)来测试了它。
成功率: 与传统方法相比,它找到了更多的“命中”(即符合目标的分子)。
可建造性: 它设计的几乎所有分子都附带了一个有效的构造配方。
多样性: 它不仅仅是复制粘贴旧的设计;它创造了既符合目标又具有多样性的新形状。
简而言之,SynLaD 是一个帮助药物设计者跳过“意识到一个绝妙想法在现实中无法实现”这一挫败环节的工具。它确保了它建议的每一个分子既是工作的完美契合者,也是可以在真实实验室中实际制造出来的。
技术摘要:SynLaD
问题陈述
基于配体的药物设计(LBDD)依赖于药效团图谱(pharmacophore profiles)——即氢键供体、受体和疏水性等相互作用特征的空间排列——来指导新生物活性分子的发现。虽然目前的生成模型可以有效地捕捉理想的 3D 分子形状和药效团分布,但它们经常产生合成不可及的分子。相反,具备合成感知能力的生成方法往往无法对丰富的 3D 化学特征进行约束,从而限制了其设计具有特定结合性能分子的能力。这造成了一个瓶颈:模型要么为了优化形状而牺牲可合成性,要么反之亦然,从而阻碍了高评分且在实验上可行的命中化合物(hits)的发现。
方法论
作者提出了 SynLaD (合成感知潜空间扩散模型),这是一个将 3D 分子设计与合成可及性统一起来的条件潜空间扩散框架。该架构分为两个不同的阶段运行:
1. 多头变分自编码器(阶段 1)
一个共享编码器将 3D 分子(由离散原子类型和连续坐标表示)映射到一个连续的潜空间。该潜空间由两个专门的解码头进行解码:
3D 解码器: 一个带有双向掩码的 Transformer,用于重建原子类型和 3D 坐标,以确保几何保真度。
合成解码器: 一个自回归 Transformer,生成序列化的合成路径(代表反应有向无环图的线性标记序列)。该解码器通过交叉注意力机制根据潜向量进行约束。
训练目标: 解码器通过结合用于 3D 重建的交叉熵和均方误差(MSE)损失,以及用于合成序列重建的交叉熵的加权损失函数进行联合训练,并使用 KL 散度项进行正则化,以使潜空间与标准正态分布对齐。
2. 条件潜空间扩散(阶段 2)
在阶段 1 学习到的潜空间上训练一个扩散 Transformer(DiT)。
约束条件: 扩散过程受药效团图谱的约束,药效团图谱由离散特征类型(例如供体、受体、芳香环)及其 3D 坐标表示。这些特征通过 Transformer 编码器进行嵌入,并通过交叉注意力机制注入到 DiT 中。
生成: 在推理过程中,DiT 根据目标药效团对新的潜向量进行采样。随后,这些潜向量由 3D 解码头和合成解码头进行解码。
反应预测: 由于合成解码器在生成过程中输出的是反应物和反应类型的序列,而非最终产物的身份,因此需要使用一个独立的反应预测预言机(基于 BART)来从生成的反应物中推断出产物结构。
核心贡献
双重约束潜空间: 本文引入了一个将两种互补但通常相互竞争的表示相结合的潜空间:3D 分子结构和合成路径。联合训练促使潜空间能够同时被解码为有效的几何结构和可执行的合成路线。
药效团约束的潜空间生成: 与依赖固定反应模板或未对原始 3D 特征进行约束的现有合成约束模型不同,SynLaD 使用扩散模型根据丰富的 3D 药效团图谱对潜空间进行采样。这使得设计过程不受限于狭窄的预定义化学空间。
端到端评估协议: 作者提出了一种协议,共同评估多样性、合成可及性和目标约束下的命中发现能力,并将其方法与库筛选以及其他摊销/非摊销基准模型进行显式对比。
实验结果
该模型在 USPTO 数据集上进行训练,并在 Lit-PCBA 基准测试上进行生物活性命中化合物的多样化评估。
无条件生成: SynLaD 的分子质量(有效性、多样性、新颖性)与单独训练的对应模型相当,同时一致地提高了具有合理合成路径的样本比例。研究发现,联合训练提高了由 3D 解码头解码出的分子的可合成性,这表明合成解码头能引导生成过程向更具可行性的潜空间区域移动。
药效团约束生成: 在分布内任务中,与随机选择训练分子的基准相比,SynLaD 生成的样本在 3D 药效团和形状相似度上显著高于基准,同时保持了高合成可及性。
筛选案例研究: 与对约 6.7 万个分子的库进行暴力 ROCS 筛选相比,SynLaD 使用近两个数量级的更少样本(生成的 1,000 个 vs. 筛选的 67,000 个)实现了更高的命中数。
生物活性命中化合物多样化: 在 Lit-PCBA 基准测试上,SynLaD 优于包括 ShEPhERD(3D 扩散)、SynFormer(合成感知 2D)和 REINVENT(基于 RL)在内的基准模型。具体而言,SynLaD 的合成解码器产生的候选化合物具有更高的 ROCS 形状/颜色重叠度和更多的命中数(对比 SynFormer);同时其 3D 输出在命中数和合成可及性方面均优于 ShEPhERD。
消融实验: 去除 3D VAE 和扩散模块(直接将药效团约束于合成解码器)会导致命中数和多样性大幅下降,证明了结构感知潜空间组件的必要性。同样,用基于 SMILES 的 VAE 替换 3D VAE 会降低命中质量,证实了显式 3D 表示学习的价值。
重要性与主张
本文声称 SynLaD 证明了单一模型可以产生既符合形状特征又具有可行合成方案的分子,有效地弥合了 3D 化学特征约束与可合成分子生成之间的鸿沟。作者断言,其方法缓解了基于反应模板的方法所存在的“模板瓶颈”,并避免了暴力筛选带来的计算限制。
该研究强调,针对 3D 结构和合成路径联合训练解码器是互利互惠的:它增加了 3D 解码分子的可合成性,并提高了合成解码器满足形状约束的能力。作者得出结论,通过 3D 信息丰富的潜空间来约束自回归合成解码器,可以产生大量多样化、符合药效团要求且可合成的命中化合物,从而有望通过减少对昂贵实验筛选流程的依赖,加速早期药物发现进程。
作者对其局限性保持了谦逊的态度,指出该框架目前依赖外部反应预测器(这会引入潜在偏差),且仅限于 USPTO 数据集。他们建议未来的工作可以涉及扩展到更大的反应数据集(如 Pistachio)并改进跨解码器的一致性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。