想象一下,你正试图通过电话向朋友描述一个复杂的乐高结构,以便他们能搭建出一个完全相同的复制品。
旧方法(传统指纹)
长期以来,科学家们使用一种称为"Morgan 指纹”的方法来描述分子(分子就像是由原子构成的微小乐高结构)。这就像给你的乐高城堡拍张照片,将其压扁,然后让它通过一台只有几个墨槽的复印机。
- 问题所在: 为了让描述能写在一张小纸片上(即固定长度的向量),机器必须对细节进行“哈希”或压缩。如果两块不同的乐高积木看起来略有相似,机器可能会不小心给它们盖上相同的墨水代码。这被称为“碰撞”。你会丢失信息。如果你试图把纸片做得更小(即维度更少),图片就会变得模糊,你再也无法区分房子和汽车了。
新方法(超维指纹)
本文作者 Jonas Teufel 及其来自卡尔斯鲁厄理工学院(Karlsruhe Institute of Technology)的同事,介绍了一种名为**超维指纹(Hyper-Dimensional Fingerprints, HDF)**的新方法。
这种方法不是将分子压扁成一张微小模糊的照片,而是想象你拥有一个巨大的、不可见的 10,000 维空间。
- 原料: 每种原子(碳、氧等)都被分配了这个巨大空间中一个独特的随机“声音”或“颜色”。
- 混合汤料: 该方法不是简单地列出原子,而是使用一种特殊的数学配方(称为循环卷积)将它们混合在一起。这就像在搅拌机中混合食材。如果你有一个碳原子紧挨着一个氧原子,那么该特定邻域的“风味”就会完美地保留在混合物中。
- 传递信息: 该方法让这些“风味”在分子周围传播,与它们的邻居“交谈”,就像学生在教室里传递纸条一样。这不仅捕捉了有哪些部件,还捕捉了整个结构是如何连接的。
- 结果: 最终的分子被表示为一个单一的、巨大的向量(一串数字)。因为这个空间如此巨大,两个不同的分子几乎永远不会偶然获得相同的“风味”。
为什么这很重要?
该论文声称这种新方法拥有三大“超能力”:
- 它是更精准的地图: 如果在这个新的“风味空间”中测量两个分子之间的距离,它能完美地匹配它们在结构上的实际差异。旧方法(Morgan)经常在这方面出错,尤其是当地图(维度)较小时。而新方法即使在地图非常小的情况下也能保持准确。
- 它无需训练即可工作: 大多数现代 AI 方法就像需要研读数千本教科书(训练数据)才能学会识别分子的学生。而这种方法就像一个天才,它只需知晓数学规则。它不需要学习,只需瞬间计算出答案。
- 它小巧却强大: 你可以将这个新指纹缩小到非常小的尺寸(例如 32 或 64 个数字),它依然表现优异。而旧方法在这个尺寸下就会分崩离析。
现实世界的测试
研究人员在名为贝叶斯优化的“分子寻宝”游戏中测试了这种方法。想象你是一位厨师,试图找到一种新药的最佳配方,但你一次只能品尝几道菜。
- 使用旧指纹,厨师不得不品尝数百道菜,才能接近完美的那一道。
- 使用新的超维指纹,厨师甚至在“配方卡”非常小的情况下,也在极短的时间内找到了完美配方。
结论
该论文得出结论:我们在分子描述中认为不可避免的信息丢失,并非指纹这一概念本身的缺陷,而是旧式压缩方法(即复印机方法)的缺陷。通过使用高维数学代替哈希,我们可以在不需要超级计算机或海量训练数据集的情况下,保留所有重要细节。这是一种更简单、更快速、更准确地描述生命基本构建模块的方法。
以下是 Jonas Teufel 等人论文《作为分子表示的超维指纹》的详细技术总结。
1. 问题陈述
分子指纹是用于虚拟筛选、性质预测和材料发现等化学信息学任务所必需的固定大小向量表示。
- 传统指纹的局限性: 传统方法(如 Morgan/ECFP)依赖基于哈希的折叠将子结构特征压缩为固定长度的位向量。由于位冲突,这一过程会导致信息丢失,特别是在使用低维嵌入时。因此,向量空间中的结构相似性往往无法准确反映分子的真实拓扑相似性(图编辑距离)。
- 学习表示的局限性: 图神经网络(GNN)提供了更高的表达能力,但需要特定任务的训练、大量的计算资源,并且往往难以泛化到训练分布之外的领域。
- 差距: 需要一种分子表示,既能结合传统指纹的效率和确定性,又能具备 GNN 的结构表达能力,且无需训练。
2. 方法论:超维指纹 (HDF)
作者引入了超维指纹 (HDF),这是一种基于超维计算 (HDC) 的无需训练的分子表示。HDF 用高维向量上的代数运算取代了消息传递神经网络中的学习变换。
核心组件
- 原子嵌入:
- 原子属性(元素类型、氢原子数、键数)通过预定义字典映射到随机高维向量(超向量)。
- 初始节点嵌入通过绑定(循环卷积)这些原子超向量形成:hi(0)=atome⊙hydrogenh⊙bondsb。
- 迭代消息传递:
- 结构信息通过 L 次迭代在分子图上跨节点传播。
- 在每一步中,节点通过将其当前状态与邻居状态绑定来聚合邻居信息:hi(l+1)=normalize(∑j∈N(i)hi(l)⊙hj(l))。
- 这模仿了传统指纹中圆形邻域的扩展,但在代数上保留了多跳结构上下文。
- 全局聚合:
- 来自所有迭代的节点嵌入被求和并归一化,以捕捉局部环境。
- 通过对所有节点嵌入求和,获得置换不变的图读出。
- 全局属性: 宏观属性(分子大小和图直径)使用分数幂编码(将标量值映射到超向量)进行编码,并与结构读出捆绑在一起。
- 数学基础:
- 该方法利用全息约化表示 (HRR),其中绑定通过循环卷积执行。该操作近似可逆,并保持了高维随机向量的准正交性,从而能够在没有位冲突的情况下实现鲁棒的分布式表示。
3. 主要贡献
- 无需训练的确定性: HDF 以确定性方式生成分子表示,无需任何模型训练,使其可立即应用于任何数据集。
- 忠实的结构相似性: 与基于哈希的方法不同,HDF 保留了分子之间的拓扑距离。HDF 空间中的距离与图编辑距离 (GED) 高度相关。
- 维度效率: HDF 在极低维度(例如 32–256 个分量)下保持高预测性能,而在该范围内,传统指纹会因冲突导致的信息丢失而显著退化。
- 泛化能力: 该方法与模型无关,可与各种机器学习范式(KNN、随机森林、神经网络)有效配合使用。
4. 关键结果
作者在多种性质预测基准(QM9、FreeSolv、BACE、AqSolDB 等)上将 HDF 与 Morgan 指纹、RDKit 指纹及其他基线进行了评估。
- 与图编辑距离 (GED) 的相关性:
- 在32 维下,HDF 与 GED 的皮尔逊相关系数约为 0.9,而 Morgan 指纹仅为**~0.55**。
- 这表明 HDF 嵌入形成了一个度量空间,其中化学性质相似的分子始终彼此更接近。
- 预测性能:
- HDF 在大多数任务中优于传统指纹,特别是在量子力学性质(零点能、焓)方面,因为这些性质中原子环境之间的物理关系至关重要。
- 在低至32 到 256的维度下,HDF 实现了比 Morgan 指纹更低的预测误差。
- 在K 近邻 (KNN) 回归中,HDF 表现出卓越的性能,证实了其距离结构非常适合基于相似性的方法。
- 贝叶斯优化 (BO):
- 在分子优化任务(针对 ClogP 和 QED)中,基于 HDF 的代理模型表现出显著改善的样本效率。
- 在 64 维下,基于 HDF 的 BO 在约 20 轮内收敛到最优目标,而 Morgan 指纹的表现与随机搜索相当。
- 这通过将嵌入维度从数百降低到几十,使得在大型库(如 ZINC250k)上进行高斯过程推断成为可能,将优化运行时间从数天缩短至数小时。
5. 意义与影响
- 重新定义指纹范式: 结果挑战了信息丢失是固定长度指纹固有属性的假设。相反,该论文表明,丢失是基于哈希的编码的局限性,而非指纹概念本身的局限。
- 实际效用: HDF 提供了一种“鱼与熊掌兼得”的解决方案:兼具传统指纹的速度和可解释性,以及 GNN 的结构保真度。它对于需要低维、高保真表示的样本高效优化和相似性搜索特别有价值。
- 未来方向: HDF 的代数性质(绑定操作的近似可逆性)为可解释 AI和生成分子设计开辟了新途径,可能允许从指纹向量中重建分子子结构。
总之,超维指纹代表了分子表示领域的范式转变,它利用“维度的祝福”创建了紧凑、无需训练且结构忠实的描述符,在预测准确性和优化效率方面均优于传统方法。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。