Multi-Agent Closed-Loop Reasoning for Organic Structure Elucidation from Multimodal Spectra
本文介绍了 MACROS,这是一个在海量模拟和实验数据集上训练的多智能体系统,它通过模拟专家假设检验并学习基础化学原理,能够以空前的准确度和零样本泛化能力,自主阐明复杂有机结构的多种模态光谱。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在诞生新药以及解码自然奥秘的实验室里,科学家们面临着一个持久的难题:仅凭观察分子如何与光和磁场相互作用,来确定其精确的形状。当化学家合成一种新化合物或从植物中分离出一种物质时,他们必须证明该物质究竟是什么。他们通过运行机器来产生复杂的信号模式,这些模式被称为光谱。这些信号就像分子的独特指纹,包含了关于其原子如何连接以及在空间中如何排列的线索。几十年来,解读这些指纹一直是一个缓慢且耗费人力的过程,需要人类专家通过不断测试一种可能的结构是否符合另一种结构,来拼凑出所有的线索。虽然计算机提供了一些帮助,但它们难以复制人类专家的灵活逻辑思维,在面对从未见过的分子或混乱的数据时往往会失败。
现在,一组研究人员开发出了一种改变这一工作方式的新系统。该系统并没有试图强迫计算机仅仅去记忆已知分子的数据库,而是构建了一个能够像化学家一样思考的人工智能。这个名为 MACROS 的系统不仅仅是在猜测结构;它会提出一个候选方案,检查自己的工作,并循环往复地完善答案,这与人类的做法如出一辙。通过在数百万个模拟和现实世界的案例上进行训练,该系统已经学会了如何在原始信号与原子的三维排列之间建立联系。结果表明,这是一个能够以超越现有方法的速度和准确度识别复杂分子的工具,即使在数据不完整或分子完全陌生的情况下也是如此。
这一突破的核心在于系统的构建方式。研究人员并没有创建一个处理所有事务的单一庞大“大脑”,而是创建了一个由专门的数字代理组成的团队,每个代理都有特定的职责。一个代理观察数据并建议一个可能的分子结构;另一个代理获取该建议,并模拟如果该结构真实存在,其信号将会呈现出怎样的样子;第三个代理则将模拟出的信号与实际的实验数据进行对比,以观察匹配程度如何。如果匹配效果不佳,系统会将信息传回给第一个代理重新尝试。这种提出、测试和完善的循环是自动且反复进行的。系统会在实时过程中从自身的错误中学习,通过不断缩小可能性范围,直到找到最能解释所有观测信号的结构。这种方法模仿了人类波谱学家传承数代的迭代假设检验过程,但其执行速度和一致性却远超人类。
使该系统特别卓越之处在于,它自主学习了化学规则。研究人员并没有用一套化学规则来对其进行编程,也没有告诉它哪些原子通常会连接在一起。相反,他们让系统接触了超过一亿对光谱和分子结构。通过这种大规模的接触,系统自发地发现了基本的化学原理。例如,它学会了数据中的特定模式对应于特定的原子团(如环状结构或双键),而无需被明确告知去寻找这些特征。它还发展出了一种倾向,即在进行结构猜测时优先从刚性的环状系统开始,这一策略反映了经验丰富的专家直觉——他们知道构建分子往往始于其最稳定的核心。这种学习化学底层逻辑而非仅仅记忆模式的能力,使得该系统能够泛化到它从未遇到过的分子上。
研究人员在各种现实世界的样本上测试了该系统,包括自然界中的复杂天然产物、实验室合成的化合物以及人体内的代谢物。在许多情况下,该系统能够利用 1H 和 13C 核磁共振数据(一种常见但往往具有歧义性的信号类型)正确识别分子结构。当系统被允许运行完整的思考和完善循环时,其准确度显著提高。在一组具有挑战性的天然产物测试中,该系统在没有任何针对特定化合物进行预训练的情况下,正确识别了超过一半的分子结构。当研究人员针对特定类型的化学领域对其进行微调后,其成功率进一步攀升,在解决代谢物案例时,成功率接近 70%。即使在数据存在噪声或不完整的情况下,这种性能依然稳健,展示了以往计算机方法所缺乏的鲁棒性。
该系统价值最令人信服的证据来自于它如何与人类科学家协作。在一项受控研究中,专业波谱学家被要求先独立解决复杂分子的结构问题,然后再在系统的辅助下进行。在单独工作时,专家解决单个分子大约需要一小时,其指纹相似度得分为 0.102。当他们使用系统辅助时,每个分子的处理时间降至仅十分钟,且相似度得分跃升至 0.80 以上。该系统并未取代人类专家,而是充当了一个强大的伙伴,承担了生成和测试数千种可能性的繁重工作,从而让专家能够专注于最终的验证。这种协作表明,结构测定的枯燥工作正在实现自动化,从而将科学家从繁琐工作中解放出来,让他们专注于发现与创新。
这项工作的意义远不止于更快地解决谜题。通过建立一种从常规数据中确定分子结构的可靠方法,该系统为探索化学领域的广阔“暗物质”打开了大门——即自然界和人体内存在、但从未被识别出的数百万种未知分子。目前,由于识别过程过于缓慢且困难,许多此类分子仍处于“隐形”状态。有了这样一个能够快速且准确解码信号的工具,科学家可以主动发现新药,更深入地理解生物过程,并加速新材料的开发。该系统代表了一种从单纯存储数据向主动利用数据进行推理的转变,为实现分子发现速度与思维同步的完全自动化实验室奠定了基础。
这种方法的成功也凸显了人工智能在科学领域的新方向。研究人员并没有试图将科学数据强行转化为文本或图像等通用格式,而是设计了一个能够直接使用数据原生语言进行交流的系统。这些代理直接在原始信号和代表分子的化学字符串上进行训练,从而保留了在翻译过程中往往会丢失的细微物理关系。这种专门的设计使得该系统能够以比通用模型更少的计算资源实现高精度。这表明,科学 AI 的未来不在于构建更大、更通用的模型,而在于构建专门的、可解释的系统,这些系统从底层开始就是为了理解其所属领域的特定逻辑而设计的。通过将这种专门知识与闭环推理过程相结合,研究人员创造了一个不仅是在计算,而且真正理解化学世界的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。