Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap
这项针对 35 个自主研究智能体系统的调查显示,尽管代码发布已非常普遍,但由于缺乏具有可复现性的级制品和经过外部验证的声明,一个关键的验证差距依然存在,这表明该领域的主要瓶颈已从任务完成转向了声明验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:科学家们不再仅仅把计算机当作计算器,而是将其视为能够思考、规划甚至撰写最终报告的合作伙伴。这就是“自主研究智能体”(autonomous research agents)的前沿领域——这些 AI 系统旨在完成科学工作的全过程:提出新想法、阅读他人的著作、运行实验、分析数据并起草论文。长期以来,一个核心问题很简单:“这些 AI 机器人真的能完成这项工作吗?”但随着这些系统在产出论文方面的能力不断提升,问题已经发生了转变。现在,我们必须问:“我们能信任它们所说的话吗?”
要理解这个问题,可以想象一个写数学论文的学生。如果他们只交给你写着答案“42”的最后一页,你只能听凭他们的说法。但如果他们交给你整个笔记本,展示了每一个演算步骤、使用的具体数字以及采取的确切步骤,你就可以检查他们的作业。在 AI 科学的世界里,“笔记本”就是代码和数据日志。我们正在讨论的这篇论文观察了一群这类 AI 科学家,看看它们是在交出笔记本,还是仅仅交出了最终答案。结果发现,虽然许多系统擅长完成“论文写作”,但很少有系统愿意通过展示其工作过程的方式,让任何人都能复核其“数学计算”。
伟大的“展示过程”短缺
这篇论文就像是对新一代“AI 科学家”进行的一次大规模、详尽的审计。作者收集了 24 个声称能自主进行研究的不同系统,并仔细观察了它们向公众发布的内容。他们发现了一个奇怪且令人担忧的模式:代码很常见,但证明却很罕见。
想象一家面包店,每个面包师都递给你一个看起来很美味的蛋糕(代码)。你可以看到这个蛋糕,它看起来很真实。虽然 83% 的面包师会把食谱(代码)交给你,但其中 62% 的人拒绝提供制作这个蛋糕所需的精确初始数值、定时器设置或逐步日志(种子和执行轨迹)。没有这些细节,你就无法亲手制作这个蛋糕来验证味道是否一致。论文发现,虽然 83% 的系统发布了其代码,但只有 38% 发布了完美复现实验所需的特定“种子”或“轨迹”。这就像是拿到了一张魔术照片,却拿不到魔术师表演时的操作说明。
“自我评分”陷阱
论文还调查了这些 AI 系统是如何判断自己的想法是否优秀的。在一个健康的科学实验室里,一位科学家提出一个想法,然后由另一位独立的专业人士来检查其是否属实。但许多这类 AI 系统就像是那些自己出题并给自己打分的学生。
作者发现,大多数这类“闭环”系统(即 AI 从头到尾运行整个实验的过程)实际上是“机械循环”。它们运行一个测试,得到一个分数,如果分数足够高,它们就会说:“太棒了,我发现了一些东西!”但这个“分数”通常只是 AI 自己计算出的一个内部数值,而不是针对现实世界的检验。在九个声称是完全自主(Level 4)的系统中,有七个仅仅是在运行这些内部机械循环,而一个仅仅是作者在说“它有效”却拿不出证据。在整个群体中,只有一个系统通过了外部物理检查的验证(例如机器人真的在真实的实验室里混合化学物质),而且那个系统是在当前这波 AI 浪潮开始之前就构建好的。
“新颖性”幻觉
另一个重大发现是关于“新颖性”的。科学应该是发现前人未知的知识。论文观察了这些 AI 系统如何验证其想法是否真正具有新颖性。他们发现,只有 38% 的系统拥有任何验证其想法是否确实新颖的方法。
这就像一个作家声称他的故事是一个全新的情节。如果他不去图书馆查阅是否有人已经写过这个故事,他可能只是在无意中抄袭了一本旧书。论文指出,许多 AI 系统生成的想法在 AI 看来是“新”的,但对世界而言可能并不新颖,因为没有人真正去检查“图书馆的书架”。
“黑箱”中的信任
作者认为,我们目前正处于一个“验证鸿沟”之中。我们拥有可以撰写论文和运行代码的 AI 系统,但我们缺乏验证这些论文是否真实的工具。他们指出:
- 代码发布率很高 (83%),但可复现性很低 (38%)。
- 新颖性检查非常罕见 (38%)。
- 外部验证在新的 AI 系统中几乎不存在。
这篇论文并不是说这些 AI 科学家是没用的。它是在说,它们就像是非常快速、非常有自信的作家,但还没有学会如何记一份妥当的日记。在它们开始交出完整的笔记本(种子、轨迹和独立检查)之前,我们无法确定它们的“发现”是真实的,还是仅仅是极具说服力的幻觉。
总结:面向未来的清单
论文最后为任何评审这些 AI 科学家的行为提供了一份“报告清单”。这是一套规则,旨在确保 AI 不仅仅是说“我做到了”,而是要证明它做到了。这些规则包括:
- 展示种子: 提供精确的初始数值,以便他人可以重演实验。
- 展示选择策略: 说明你是如何从所有尝试的结果中挑选出“最佳”结果的。
- 证明其新颖性: 展示你是如何检查你的想法是否已为人所知。
- 让局外人评判: 不要让 AI 给自己的作业打分;要使用一个独立的检查者。
简而言之,论文表明,虽然 AI 在“做”科学方面变得很擅长,但在“证明”科学方面仍然很糟糕。下一个重要的步骤不是构建更聪明的 AI,而是构建更好的检查其工作的方法。在此之前,我们应该以一种审慎的态度对待这些 AI 生成的论文,等待它们“展示其工作过程”之后再相信答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。