← 最新论文
🤖 AI

Can AI Agents Synthesize Scientific Conclusions?

本文介绍了 SciConBench 以及一个洁净室评估框架,旨在证明当前的 AI 智能体难以可靠地合成准确的科学结论,且由于数据泄露,其在无约束设置下的性能被显著高估。

原作者: Hayoung Jung, Pedro Viana Diniz, José Reinaldo Corrêa Roveda, Abner Fernandes da Silva, Haeun Jung, Enoch Tsai, Aleksandra Korolova, Manoel Horta Ribeiro

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Hayoung Jung, Pedro Viana Diniz, José Reinaldo Corrêa Roveda, Abner Fernandes da Silva, Haeun Jung, Enoch Tsai, Aleksandra Korolova, Manoel Horta Ribeiro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个复杂的谜团:“治疗某种特定疾病的最佳方法是什么?”

在过去,你必须去图书馆,阅读数百本落满灰尘的书籍,然后亲自撰写一份答案摘要。而今天,我们拥有了 AI Agent(人工智能智能体)——它们是超级聪明的数字侦探,能够搜索整个互联网,阅读数千篇文章,并在几秒钟内为你写出一份总结。

但这里有一个核心问题:这些 AI 侦探真的能找对事实吗?还是仅仅在瞎猜?

这篇题为 《AI Agent 能合成科学结论吗?》(Can AI Agents Synthesize Scientific Conclusions?) 的论文,设计了一场大规模、高风险的测试来寻找答案。以下是他们所做的工作以及研究发现的简要说明。

1. “实战”测试 (SCICONBENCH)

研究人员创建了一个巨大的测试集,称为 SCICONBENCH。你可以把它看作是一个针对 AI 的、不断更新的庞大“期末考试”。

  • 问题来源: 他们提取了 9,100 个医生和科学家实际提出的真实医学问题。
  • 标准答案: 对于每一个问题,他们都准备了由人类专家编写的“金标准”答案(这些答案来自 Cochrane Library,它被誉为医学研究界的“奥林匹克”)。
  • 目标: 他们要求 AI Agent 搜索公开网络,阅读证据,并写出自己的结论。然后,将 AI 的答案与人类专家的答案进行对比。

2. “无尘实验室”难题

这里有一个棘手之处。如果你问 AI 一个问题,而答案就摆在 Google 搜索结果的第一页,AI 可能会直接复制粘贴答案,而不是真正地进行“思考”。这被称为 “泄露”(Leakage)。这就像一名学生在考试时通过查看藏在桌下的答案来作弊。

为了解决这个问题,研究人员构建了一个 “无尘实验室”(称为 SCICONHARCHESS)。

  • 想象一个特殊的、隔音的图书馆,AI 被允许阅读书籍,但 包含答案的关键书籍被锁在了保险库里。
  • AI 必须通过阅读其他书籍、连接信息点并对证据进行推理来找到答案,就像人类一样。
  • 这确保了测试的是 AI 的“思考”能力,而不仅仅是它寻找隐藏“作弊纸”的能力。

3. 结果:AI 仍在苦苦挣扎

研究人员测试了目前最智能的 8 种 AI 模型和“深度研究型”智能体。结果令人惊讶且有些令人担忧:

  • 得分: 即便是最优秀的 AI,也只得到了 0.337 分(在 1.0 为满分的量表中)。按学校评分标准来看,这大约相当于一个 D
  • “作弊”效应: 当他们移除“无尘实验室”限制(即让 AI 能够看到答案)时,得分上升了。这证明了 AI 的许多“成功”仅仅在于直接找到了答案,而不是通过合成得出的。
  • 错误类型: AI 不仅仅是遗漏细节,它们经常会出错
    • 不完整: 它们会遗漏关键事实(例如忘记提到副作用)。
    • 矛盾: 它们有时会说出与专家答案直接相反的内容(例如在专家说某种药物无效时,AI 说该药有效)。
    • 混淆: 它们会混淆不同的医疗状况或治疗方法。

4. “消费者”检测

他们还测试了普通人日常使用的 AI 工具,如 Google AI OverviewOpenEvidence

  • 尽管这些工具是为健康领域设计的,并且可以获取“金标准”答案,但它们的表现依然很差。
  • 它们经常给出不完整或自相矛盾的建议。研究人员警告说,由于 AI 经常会忽略那些可能改变医生决策的细微之处,因此依靠这些工具进行严肃的健康决策是危险的。

5. 核心启示

论文的结论是:可靠的科学合成仍然是一个尚未解决的挑战。

你可以这样理解:目前的 AI Agent 就像是 非常快速、非常热情的实习生。它们可以在一分钟内阅读百万页的内容。但目前,它们还不擅长通过 连接信息点 来形成一个单一、准确且达到专家水平的结论,而不出错或不遗漏最重要的细节。

底线是:
我们目前还不能信任 AI 去充当科学或医学结论的“最终判官”。它们是收集信息的有用工具,但在涉及生命安全时,仍然需要人类专家来复核其工作。研究人员同时强调,我们需要在这些“无尘实验室”中持续测试 AI,以确保我们不会被它们“仅仅是找到答案”而非“理解答案”的能力所蒙蔽。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →