想象一个世界,你可以雇佣一支由超级聪明、不知疲倦的机器人组成的团队来帮你完成作业。你给它们一个主题,它们本应就此开展研究、运行实验、撰写论文,并将其提交至一家享有盛誉的科学会议。
这篇名为《MLReplicate》的论文,本质上是对其中六名“机器人研究员”的“成绩单”。作者希望探究这些人工智能系统是否真的能够从事真正的科学研究,还是仅仅擅长伪装。
以下是他们实验的简明拆解:
1. 实验设置:一场“烹饪”挑战
研究人员并没有仅仅要求机器人“写关于人工智能的文章”,那样太模糊了。相反,他们从顶级会议(ICML 2025)选取了8 篇真实的获奖科学论文,并将它们转化为“食谱卡”。
- 食谱卡:研究人员没有把完整的成品菜(即原始论文)交给机器人,而是只给了它们食材清单和目标(例如:“做出一道味道像这种特定风味的蛋糕”)。
- 参赛者:六个不同的人工智能系统(如AI Scientist、Agent Laboratory和Tiny Scientist)获得了这些食谱卡。它们的工作是进入厨房,从零开始烹饪这道菜,并将其作为一篇新论文端上桌。
2. 厨房混乱:出了什么问题?
结果有些灾难性,但极具启发性。
- “烤焦吐司”问题:在 48 次尝试中,有 3 个机器人完全放弃了,另有 8 个试图提交篇幅过短的论文(例如,在要求 5 页的情况下提交了一篇 2 页的短文)。
- “虚假食材”问题:这是最大的问题。机器人出现了幻觉。它们会撰写从未实际运行过的实验,编造虚假数据,或声称使用了不存在的数据库。这就像一位厨师声称自己制作了一块牛排,但实际上只是在餐巾纸上画了一幅牛排的图画。
- “幽灵”问题:有些机器人撰写的论文外表看起来完美无缺(排版精美、用词华丽),但内部却是空的。它们留下了诸如"[在此插入数据]"这样的占位符,却忘记填充内容。
3. 评审团:机器人 vs. 人类
研究人员使用了两种类型的评审来给论文打分:
- 机器人评审:扫描论文关键词和结构的自动化系统。
- 人类评审:仔细阅读论文的真实科学家。
令人震惊的结果:机器人评审很容易被愚弄。它们给充满谎言的论文打了及格分。然而,人类评审非常严厉。他们立即识破了虚假数据和缺失的实验。
- 脱节:机器人与人类之间几乎没有任何共识。机器人喜欢的论文,人类却予以拒绝。
- 谎言率:在机器人评审确实接受的论文中,仍有**59%**包含人类评审识破的虚构声明。
4. 运营成本
研究人员还检查了每个机器人的“收据”。
- 昂贵的失败:其中一个系统(AI Researcher)是个“重劳力”。它消耗了巨大的计算资源,运行成本高昂。这就像雇佣了 50 名厨师来制作一个三明治。
- 廉价的赢家:另一个系统(Agent Laboratory)则更便宜、更快速。
- 教训:花费更多金钱或使用更多计算资源并没有让机器人变得更聪明或更诚实。事实上,最便宜的系统往往比最昂贵的系统做得更好。机器人“大脑”的设计比它燃烧了多少“燃料”更为重要。
5. 核心结论
该论文得出结论:虽然这些人工智能系统在撰写和排版方面变得越来越擅长,但它们尚未准备好从事真正的科学研究。
- 它们是出色的模仿者:它们可以完美地模仿科学论文的风格。
- 它们是糟糕的科学家:它们无法可靠地运行实验、检查自己的工作,或区分真实事实与虚构故事。
启示:我们暂时还不能让人工智能独自运营实验室。如果我们这样做,最终可能会得到一个装满完全虚构的精美书籍的图书馆。我们仍然需要人类专家来手持“真相探测器”,确保科学是真实的。该论文建议,我们构建这些人工智能系统的方式(它们的工作流程)比仅仅让它们变得更大或更昂贵更为重要。
技术摘要:MLReplicate——机器学习可复现性自主研究系统的基准测试
问题陈述
尽管能够生成完整科学手稿的自主研究系统取得了快速进展,但稳健且现实的评估框架却未能跟上步伐。现有的基准测试通常仅针对研究生命周期的孤立阶段(如创意生成、实验执行或代码复现),而非端到端的全流程。此外,当前的评估往往依赖大语言模型(LLM)作为评判者,而这些模型与人类专家判断的一致性尚不明确,导致难以区分真正的科学贡献与看似合理但流于表面的输出。另外,几乎所有现有基准测试都将输出质量与实际部署因素(如计算成本、运行时间和所需人工干预程度)割裂开来进行评估,而这些因素对于确定现实世界的可行性至关重要。
方法论
为了填补这些空白,作者引入了MLReplicate,这是一个旨在评估机器学习可复现性自主研究系统的端到端基准测试。
数据集构建
该基准测试基于8 篇 ICML 2025 杰出论文构建,涵盖多个子领域(深度学习、概率建模、生成模型、公平性和元科学)。每篇论文被重构为标准的“真实规范”,将原始手稿抽象为一组假设、实验设计、评估指标和关键发现。该规范作为所有下游系统的标准输入,确保约束条件一致,同时有意省略隐含的设计选择,以反映信息往往不完整的现实研究条件。
被评估系统
评估了六个最先进的自主研究系统,共生成45 份手稿:
- AI SCIENTIST-V1(顺序工作流)
- AI SCIENTIST-V2(代理树搜索)
- AGENT LABORATORY(多代理系统,可选人工反馈)
- CYCLERESEARCHER(专注于写作和评审的微调大语言模型)
- AI RESEARCHER(统一代理框架)
- TINY SCIENTIST(顺序工作流)
评估协议
评估采用双重协议方法:
- 自动化会议式评审:37 份有效提交(在过滤掉 3 份实验失败和 8 份因篇幅不足被拒稿的论文后)通过首届国际人工智能科学家会议(ICAIS 2025)流程,由三个自动化评审模型(DeepReviewer、ZGCA 和 SafeReviewer)进行评估。
- 结构化专家人工评估:通过自动化流程的 10 篇论文接受了三位具有研究生级别机器学习研究经验的人类专家的独立评审。评审者对六个维度(技术质量、清晰度、重要性、原创性、格式、引用相关性)进行 4 分量表评分,提供关于幻觉的二元判断,并在 6 分量表上给出总体建议。
运营指标
该研究系统性地追踪了计算成本(美元)、运行时间(实际耗时)、令牌使用量(输入/输出)以及后处理(格式调整、引用对齐、LaTeX 编译)所需的人工干预程度。
主要结果
录用率与质量
- 低录用率:在 37 份有效提交中,仅有10 份被自动化评审流程录用。AGENT LABORATORY占其中 5 份,而AI SCIENTIST-V2未获得任何录用。
- 人类批评:人类评审者比自动化流程更为严厉。在所有系统中,平均总体评分均落在“勉强拒稿至拒稿”的范围内。没有任何系统生成的输出被人类专家认为是可靠且达到发表标准的。
- 幻觉:普遍存在幻觉现象,59%的所有评估包含捏造或无支持的声明。具体而言,AI RESEARCHER的 100% 提交和TINY SCIENTIST的 67% 提交包含幻觉。
- 方法论缺陷:人类评审者一致发现了方法论上的不一致,例如仅在合成数据集上进行的评估、未解决的模板占位符(如
[Dataset Name])以及对不存在代码模块的引用。
自动化与人类判断的相关性
- 整体相关性弱:自动化与人类总体评分之间的相关性微弱且统计上不显著(Pearson r = +0.29)。
- 维度细微差别:特定维度出现了中等至强相关性:严谨性(r = +0.77)和重要性/贡献(r = +0.84)。然而,清晰度/呈现仍不显著。这表明自动化评审者能够捕捉特定的底层维度,但未能将其转化为一致的整体评估。
成本与质量
- 计算量无预测力:令牌预算或计算成本均无法预测输出质量。
- 效率悖论:最便宜且最快的系统(CYCLERESEARCHER)与资源最密集的系统(AI RESEARCHER,需要约 38 倍多的输入令牌和显著更高的成本)与质量之间并未呈现线性关系。在人工评估中,资源最密集的系统并未优于更高效的替代方案。
- 设计至关重要:结果表明,自主研究工作流的设计比计算规模本身更为重要。
意义与主张
本文主张,MLReplicate建立了一个实用且可扩展的评估框架,以推动迈向可信的 AI 驱动科学发现的系统性进展。其主要贡献如下:
- 统一基准测试:这是唯一一个在单一标准化设置中,跨多个标准(创意构思、实验、实现、写作和评审)联合评估多个自主研究系统的框架。
- 双重评估协议:通过结合自动化会议式评审与结构化专家人工评估,实现了对 AI 与人类判断之间一致性和差异的系统分析。
- 运营现实检验:它揭示了当前自主研究系统在生成手稿的能力与真正的科学严谨性之间存在巨大差距。幻觉和方法论不一致的普遍存在表明,这些系统在没有重大人工监督的情况下,尚未准备好进行自主科学贡献。
- 效率洞察:该研究挑战了增加计算量或令牌预算会带来更好科学产出的假设,证明了有效的流程设计比原始资源规模更为关键。
作者将 MLReplicate 定位为迈向基于原则、以可复现性为基础的评估的基础性步骤,强调在长程推理、实验严谨性和幻觉控制方面持续进步的紧迫性,以缩小自主生成与真正科学贡献之间的差距。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。