← 最新论文
🤖 AI

COMPOSITE-Stem

本文介绍了由博士级研究人员策划的 COMPOSITE-STEM 基准测试,该测试包含 70 个涵盖物理、生物、化学和数学领域的专家编写任务,旨在通过结合精确匹配、评分细则及大模型陪审团评估机制,填补当前前沿 AI 代理在科学发现工作流中缺乏有效评估的空白。

原作者: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wol
发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillman, Yuqi Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 COMPOSITE-STEM 的新“考试”,专门用来测试人工智能(AI)代理(Agent)在科学领域的真实能力。

想象一下,以前的 AI 考试就像是在做选择题,或者回答一些死记硬背的数学题。只要背过答案,AI 就能拿高分。但这就像让一个只会背菜谱的厨师去开餐厅,他可能背得出“糖醋排骨”的配方,但真的让他进厨房切菜、炒菜、处理突发状况,他可能就会手忙脚乱。

COMPOSITE-STEM 就是为了解决这个问题而设计的“实战演练场”。

以下是这篇论文的核心内容,用通俗易懂的方式为您解读:

1. 这是一个什么样的“考场”?

  • 70 道高难度“实战题”:这个考试包含了 70 道由真正的博士、教授和科学家精心设计的题目,涵盖物理、生物、化学和数学四个领域。
  • 不是“做题”,是“干活”:AI 不能只写个答案。它必须在一个虚拟的电脑环境(就像给 AI 配了一个带工具的实验室)里,像人类科学家一样:
    • 查找资料(上网搜索)。
    • 安装软件工具(比如安装化学分析软件)。
    • 运行代码,处理数据。
    • 甚至要看懂图片(比如显微镜下的细胞图或 X 光片)。
    • 最后提交一个可执行的文件或报告。
  • 专家当考官:这些题目不是随便生成的,而是由全球顶尖大学的专家(如 MIT、剑桥、斯坦福等)亲手编写的。他们不仅出题,还制定了详细的评分标准。

2. 怎么给 AI 打分?(最聪明的地方)

以前的考试,答案对就是满分,错就是零分(就像做数学题,3.14 和 3.15 就是不一样)。但在科学探索中,过程往往比结果更重要。

  • “陪审团”评分法:这篇论文引入了一个有趣的机制——LLM-as-a-Jury(AI 当评委)
    • 想象一下,如果 AI 写了一篇关于化学反应的报告,答案不完全对,但思路很清晰,步骤也对了一半。
    • 这时候,系统会派出5 个不同的顶级 AI 模型组成“陪审团”。它们会像人类专家一样,根据详细的评分表(Rubric)来打分。
    • 如果 5 个评委里有 3 个觉得“这部分做得不错”,AI 就能拿到这部分的分。
    • 这就像高考阅卷,不仅看最后那个数字,还看你的解题步骤、逻辑推导是否合理。

3. 考试结果如何?(AI 的表现)

这次考试邀请了目前世界上最先进的 4 个 AI 模型来“应试”。结果让人大跌眼镜:

  • 分数很低:表现最好的模型(Claude Opus 4.6)只拿到了 21.4% 的分数。这意味着,在 100 道题里,它只能做对 21 道。
  • 差距巨大:有些模型甚至只拿到了 4% 或 5% 的分数。
  • 为什么这么难?
    • 工具使用能力差:很多 AI 就像“书呆子”,知道理论,但不会用工具。比如题目要求用特定的化学软件分析分子,有的 AI 甚至不知道去安装这个软件,或者安装错了。
    • 容易放弃:有的 AI 遇到一点困难(比如代码报错),就放弃了,直接随便写个答案交卷。
    • 缺乏耐心:复杂的科学问题需要一步步推导,有的 AI 走了两步觉得太麻烦,就直接猜答案了。

4. 一个生动的案例

论文里讲了一个化学题的例子:

  • 任务:分析一个复杂的分子结构。
  • 强模型(Claude):它发现电脑里没有化学软件,于是它主动去安装了专业的化学工具包,然后一步步分析,最后算出了正确答案。
  • 弱模型(GPT):它试图自己写代码去硬算,结果因为太复杂算错了,或者放弃了,最后给了一个错误的答案。
  • 启示:真正的智能不仅仅是“知道答案”,而是“知道如何找到工具并解决问题”。

5. 为什么要做这个?

  • 打破“刷题”现象:现在的 AI 太擅长背题库了,导致很多旧考试失效。COMPOSITE-STEM 的题目是新的、动态的,AI 没法靠背答案过关。
  • 推动科学进步:科学家希望未来 AI 能真正帮人类做实验、分析数据、发现新药物。但在把这么重要的工作交给 AI 之前,我们得先知道它到底靠不靠谱。
  • 公开透明:所有的题目和评分标准都公开了,就像把考卷和答案都贴在墙上,让全世界的研究者都能来研究 AI 到底哪里不行,从而改进它。

总结

COMPOSITE-STEM 就像给 AI 发了一张“实习工牌”,把它扔进一个模拟的“科学实验室”里干活。

目前的结论是:AI 还很年轻,虽然它们背熟了书本,但在真正动手解决复杂的科学问题时,还像个刚入行的实习生,经常手忙脚乱,离成为“科学家助手”还有很长的路要走。

这篇论文的价值在于,它不再问"AI 知道多少知识”,而是问"AI 能解决多少实际问题”,为未来 AI 真正融入科学研究设立了新的标杆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →