← 最新论文
💬 NLP

Closed-Loop Bayesian Molecular Inverse Design with Semantic LLM Surrogates

本文介绍了 \textbf{\method},一种闭环贝叶斯分子逆向设计框架,该框架利用冻结的大语言模型作为语义代理,直接对文本指令和优化历史进行推理,从而选择具有信息量的参考分子来引导冻结的生成器,并在药物和材料设计任务中超越或达到传统高斯过程基准的水平。

原作者: Yaoyao Xu, Xinjian Zhao, Xiaozhuang Song, Lei Bai, Tianshu Yu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaoyao Xu, Xinjian Zhao, Xiaozhuang Song, Lei Bai, Tianshu Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

寻找新药和先进材料的过程通常始于一个问题:一个分子需要具备什么样的形态才能完成特定的任务?科学家们称之为“逆向设计”。研究人员不再是通过测试成千上万种现有的化学物质来观察它们的作用,而是尝试从零开始构建一个符合精确要求的分子,例如阻断病毒或允许气体通过过滤器。挑战在于,可能的化学结构宇宙是极其广大的,据估计包含约 106010^{60} 个类药物分子。在不断变化的形状的“草堆”中寻找那几根针,难度极大。传统上,计算机试图通过生成随机候选者并将其与计算机模型进行比对来解决这个问题,但这个过程往往效率低下,在找到好的选项之前会产生许多糟糕的选择。

来自香港中文大学(深圳)和上海人工智能实验室的研究团队开发了一种引导这种搜索的新方法。他们创建了一个名为 BoMolLLM 的系统,该系统将寻找优质分子的过程不视为一次性的猜测,而是一场计算机程序与大语言模型之间的对话。在他们的方法中,计算机生成一批分子,而一个专门的人工智能则充当引导者。这个引导者阅读上一批次的结果,分析哪些结构表现最好,然后为生成器编写一组新的指令。引导者不仅仅是挑选上一轮中最优秀的分子,还会解释为什么这些分子具有前景,从而有效地教导生成器下一步该尝试什么。这创造了一个闭环,使搜索过程随着每一步而变得更加聪明,不断精炼其焦点,直到找到与所需属性高度匹配的分子。

研究人员在两种截然不同的问题上测试了这个系统。首先,他们要求它设计用于药物发现的分子,特别是寻找能够与 HIV 相互作用、穿过血脑屏障或抑制特定酶(称为 BACE)的化合物。这些任务要求分子具有二元结果:要么有效,要么无效。其次,他们在材料科学领域进行了测试,要求系统设计能够控制二氧化碳、氧气和氮气等气体流动的聚合物。这些任务更具连续性,要求分子达到一个特定的渗透率目标值,而不仅仅是单纯的通过或失败。在两种情况下,系统都被给予了有限的尝试次数来改进其结果,以模拟实际测试化学物质既昂贵又耗时的场景。

结果表明,这种对话式方法优于标准方法。当研究人员将他们的系统与“一发命中”(即计算机在没有反馈的情况下尝试一次性生成完美分子)的方法进行比较时,新方法产生了更高比例的成功候选者。它也表现得与依赖复杂统计模型来预测下一步的传统数学优化技术一样好,甚至更好。关键区别在于,新系统能够“阅读”其自身尝试的历史。它可以查看一份失败分子的列表,并说:“这些分子含有过多的重金属,”或者“这些缺乏正确的环结构”,然后将这些见解传递给下一轮生成。这种对化学结构文本及其得分进行推理的能力,使得该系统能够比仅观察压缩数值数据的模型更有效地导航化学空间。

最有趣的发现之一是,系统会根据问题的类型调整其策略。对于具有明确“通过或失败”标准的药物靶点,当系统仅仅指向上一轮中最优的例子时,效果最好。那些分子的具体结构足以引导下一步。然而,对于目标是达到精确数值目标的材料科学任务,系统需要更多的帮助。在这些情况下,引导者会提供一个简短的一句话总结作为策略,例如“专注于氟化结构”,这有助于生成器理解达到目标所需的更广泛模式。这表明,虽然该系统具有灵活性,但其沟通发现的方式必须根据其正在解决的问题的性质进行定制。

研究人员还观察到,系统会随着时间的推移自然地转变其行为。在早期阶段,它探索了各种各样的化学结构,尝试了许多不同的形状和成分,以观察可能性。随着轮次的推进,它开始更加聚焦,精炼它所发现的最具前景的结构。这模拟了人类科学家的工作方式:从广泛的想法开始,逐渐缩小范围到最可行的选项。该系统并非仅仅靠运气;它比测试的其他方法更一致、更可靠地发现了高分分子。到过程结束时,它生成的分子聚集在发现最佳候选者的化学空间区域,而不是随机散布。

这项工作证明了大语言模型可以作为科学发现的有效引导者,不仅是通过生成文本,更是通过基于数据做出战略决策。该系统并不取代对现实世界测试的需求,但它显著提高了到达实验室阶段的候选者质量。它将分子的搜索变成了一个更加透明的过程,其中每一步背后的推理逻辑都是可以被阅读和理解的。研究人员发现,通过将优化历史视为一个需要分析的故事,而非仅仅是一组数字,他们可以构建一个更高效、更智能的分子世界搜索引擎。这种方法为加速新药和新材料的发现提供了一条充满希望的路径,将一个庞大且混乱的搜索空间转变为通往解决方案的有引导的旅程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →