← 最新论文
💻 computer science

Closed-loop Auto Research for Molecular Property Prediction: Discovering and Certifying Generalizable Improvements

本文介绍了一种闭环自动研究框架,该框架利用语言模型智能体来编辑分子表示、代码模型和外部证据,通过严谨的留出测试,在多个分子特性基准测试中成功发现并验证了具有泛化能力的改进,同时将真实的迁移增益与非迁移的选择方差及分布偏移区分开来。

原作者: Jingjie Ning, Xiaochuan Li, Ji Zeng, Chenyan Xiong, Guolin Ke

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingjie Ning, Xiaochuan Li, Ji Zeng, Chenyan Xiong, Guolin Ke

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:我们如何让计算机更好地预测药物在人体内的行为?

通常,科学家们尝试调整计算机程序,就像是在调节收音机的旋钮,希望能找到最清晰的信号。但这篇文章提出了一个更大胆的问题:如果计算机不仅能调整自己的收音机,还能更换天线,甚至能走到现实世界中去寻找新的、秘密的广播电台来收听呢?

这就是闭环自动研究(Closed-loop Auto Research)。这是一个由 AI 智能体组成的团队,它们不只是微调设置;它们实际上会修改代码、改变它们观察分子的方式,并搜寻新的数据。但这里有个陷阱:仅仅因为计算机认为它找到了更好的信号,并不意味着这个信号是真的。它可能只是在“幻觉”——因为它背下了练习题的答案。

大实验:三种改进方法

研究人员设置了一个大规模挑战,包含 36 个不同的药物预测任务(例如检查某种药物是否有毒或在体内停留多久)。他们给了这些 AI 智能体三种特定的“工具”来修复计算机的性能,但有一个严格的规则:智能体一次只能使用一种工具。

  1. 特征工具(The Feature Tool): 改变计算机“观察”分子的方式(比如从黑白照片切换到 3D 模型)。
  2. 模型工具(The Model Tool): 改变计算机的“大脑”(切换用于做出预测的数学引擎)。
  3. 数据工具(The Data Tool): 出去寻找新的、外部的事实来教导计算机(比如阅读一本新的教科书)。

“魔术戏法” vs. “真本事”

这里是这篇论文最聪明的地方。通常,AI 研究人员会观察一个模型在“验证集”(练习测试)上的表现,然后说:“做得好!”但本文认为这是危险的。这就像一个学生背下了练习测验的所有答案,却在正式考试中不及格。

为了证明他们的 AI 真的聪明而不是仅仅运气好,他们使用了**“留出认证”(Held-Out Certification)**协议。

  • 第一步: AI 根据练习测试选出它表现最好的“单工具”修复方案。
  • 第二步: 他们冻结这个修复方案。他们从头开始重新训练计算机。
  • 第三步: 他们在一组全新的、AI 从未见过的问题集上进行仅有一次的测试。

这是终极的现实检验。如果分数下降了,说明 AI 只是在瞎猜。如果分数保持在高位,说明 AI 确实学到了真本事。

研究发现:取决于你在玩哪种游戏

结果令人惊讶,因为“最佳工具”取决于 AI 在处理哪个药物基准测试时。

  • 在 TDC 基准测试(22 个任务)中: 数据工具是赢家。通过寻找新的、干净的外部数据,AI 将其真实世界的得分提高了 0.013
  • 在 Polaris 基准测试(4 个任务)中: 模型工具成为了冠军。改变计算机的大脑使真实得分大幅提升了 0.042
  • 在 MoleculeNet(10 个任务)中: 特征工具模型工具都奏效了,带来了 0.011 的综合真实世界提升。

核心结论: 没有单一的“魔法棒”。正确的修复方法完全取决于你试图解决的具体问题。

两大陷阱:当 AI 对你撒谎时

论文还揭示了 AI 会如何误导自己,让它以为自己在进步,而实际上却在退步。他们称之为**“非迁移特征”(Non-Transfer Signatures)**。

  1. “幸运猜题”陷阱(选择方差/Selection Variance):
    在 TDC 基准测试中,AI 试图通过改变大脑(模型工具)来解决问题。在练习测试中,它的表现看起来非常出色,比之前高出了 0.041。但在真实测试中呢?它几乎纹丝不动,仅提升了 0.003
    为什么? AI 找到了一个“幸运”的设置,它完美契合了练习题,但其实只是噪声。这就像一个学生在练习测试中通过在每道题都猜“C”而获得了完美分数,但由于纯属巧合,在真正的考试中却不及格。

  2. “错位教室”陷阱(分布偏移/Distribution Shift):
    在 Polaris 基准测试中,AI 试图通过添加新数据(数据工具)来解决问题。它在练习测试中表现很好(提升了 0.22),但在真实测试中,它反而变差了(-0.019)。
    为什么? AI 找到的新数据来自于与测试题目不同的“宇宙”。这就像你在学习关于法国烹饪的教科书,而考试却是关于意大利烹饪的。尽管 AI 很聪明,但数据与它需要预测的现实并不匹配。

安全网:禁止作弊

这项研究最酷的部分之一是他们如何处理“数据工具”。由于 AI 被允许去寻找新数据,因此存在它可能会意外“作弊”——即找到它本该被测试的那些精确分子的风险。

研究人员建立了一个**“污染过滤器”(Contamination Filter)**——一个严格的保安。

  • 如果一个新的数据文件包含哪怕一丁点测试分子(超过 5% 的重叠),保安就会拒绝整个文件。
  • 他们拒绝了三个主要的数据库,因为这些数据与测试集的重叠率高达 64% 到 89%
  • 只有通过了这种严格检查的数据才被允许进入。

即便有了这个安全员,在 Polaris 测试中仍然发生了“错位教室”的陷阱,这证明了仅仅避免作弊是不够的;数据必须是“正确类型”的数据。

最终对决:AI vs. 标准工具

为了确保他们的“自动研究”团队不仅仅是在做标准计算机程序就能做到的事情,他们与一个**“匹配试验的 AutoML 控制组”**(一个标准的、非智能体的 AI,仅进行参数微调)进行了一场比赛。

  • 标准 AI 在真实测试中仅实现了 0.006 的微小提升。
  • 自动研究智能体则拿到了 0.042

论文指出,该智能体能够真正重写代码整理新证据的能力,赋予了它远超标准调优的巨大优势。

底线

这篇论文表明,AI 确实可以发现药物研发中真实且有用的改进,但前提是必须在它从未见过的数据上进行测试。

如果你只看练习分数,你可能会被幸运的猜测或不匹配的数据所蒙蔽。但如果你使用这种“留出认证”方法,你就能将真正的发现与虚假的幻觉区分开来。这个教训不仅适用于药物研发,也适用于任何试图学习的 AI:不要相信练习测验,要相信最终考试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →