COMPOSITE-Stem
本文介绍了由博士级研究人员策划的 COMPOSITE-STEM 基准测试,该测试包含 70 个涵盖物理、生物、化学和数学领域的专家编写任务,旨在通过结合精确匹配、评分细则及大模型陪审团评估机制,填补当前前沿 AI 代理在科学发现工作流中缺乏有效评估的空白。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 COMPOSITE-STEM 的新“考试”,专门用来测试人工智能(AI)代理(Agent)在科学领域的真实能力。
想象一下,以前的 AI 考试就像是在做选择题,或者回答一些死记硬背的数学题。只要背过答案,AI 就能拿高分。但这就像让一个只会背菜谱的厨师去开餐厅,他可能背得出“糖醋排骨”的配方,但真的让他进厨房切菜、炒菜、处理突发状况,他可能就会手忙脚乱。
COMPOSITE-STEM 就是为了解决这个问题而设计的“实战演练场”。
以下是这篇论文的核心内容,用通俗易懂的方式为您解读:
1. 这是一个什么样的“考场”?
- 70 道高难度“实战题”:这个考试包含了 70 道由真正的博士、教授和科学家精心设计的题目,涵盖物理、生物、化学和数学四个领域。
- 不是“做题”,是“干活”:AI 不能只写个答案。它必须在一个虚拟的电脑环境(就像给 AI 配了一个带工具的实验室)里,像人类科学家一样:
- 查找资料(上网搜索)。
- 安装软件工具(比如安装化学分析软件)。
- 运行代码,处理数据。
- 甚至要看懂图片(比如显微镜下的细胞图或 X 光片)。
- 最后提交一个可执行的文件或报告。
- 专家当考官:这些题目不是随便生成的,而是由全球顶尖大学的专家(如 MIT、剑桥、斯坦福等)亲手编写的。他们不仅出题,还制定了详细的评分标准。
2. 怎么给 AI 打分?(最聪明的地方)
以前的考试,答案对就是满分,错就是零分(就像做数学题,3.14 和 3.15 就是不一样)。但在科学探索中,过程往往比结果更重要。
- “陪审团”评分法:这篇论文引入了一个有趣的机制——LLM-as-a-Jury(AI 当评委)。
- 想象一下,如果 AI 写了一篇关于化学反应的报告,答案不完全对,但思路很清晰,步骤也对了一半。
- 这时候,系统会派出5 个不同的顶级 AI 模型组成“陪审团”。它们会像人类专家一样,根据详细的评分表(Rubric)来打分。
- 如果 5 个评委里有 3 个觉得“这部分做得不错”,AI 就能拿到这部分的分。
- 这就像高考阅卷,不仅看最后那个数字,还看你的解题步骤、逻辑推导是否合理。
3. 考试结果如何?(AI 的表现)
这次考试邀请了目前世界上最先进的 4 个 AI 模型来“应试”。结果让人大跌眼镜:
- 分数很低:表现最好的模型(Claude Opus 4.6)只拿到了 21.4% 的分数。这意味着,在 100 道题里,它只能做对 21 道。
- 差距巨大:有些模型甚至只拿到了 4% 或 5% 的分数。
- 为什么这么难?
- 工具使用能力差:很多 AI 就像“书呆子”,知道理论,但不会用工具。比如题目要求用特定的化学软件分析分子,有的 AI 甚至不知道去安装这个软件,或者安装错了。
- 容易放弃:有的 AI 遇到一点困难(比如代码报错),就放弃了,直接随便写个答案交卷。
- 缺乏耐心:复杂的科学问题需要一步步推导,有的 AI 走了两步觉得太麻烦,就直接猜答案了。
4. 一个生动的案例
论文里讲了一个化学题的例子:
- 任务:分析一个复杂的分子结构。
- 强模型(Claude):它发现电脑里没有化学软件,于是它主动去安装了专业的化学工具包,然后一步步分析,最后算出了正确答案。
- 弱模型(GPT):它试图自己写代码去硬算,结果因为太复杂算错了,或者放弃了,最后给了一个错误的答案。
- 启示:真正的智能不仅仅是“知道答案”,而是“知道如何找到工具并解决问题”。
5. 为什么要做这个?
- 打破“刷题”现象:现在的 AI 太擅长背题库了,导致很多旧考试失效。COMPOSITE-STEM 的题目是新的、动态的,AI 没法靠背答案过关。
- 推动科学进步:科学家希望未来 AI 能真正帮人类做实验、分析数据、发现新药物。但在把这么重要的工作交给 AI 之前,我们得先知道它到底靠不靠谱。
- 公开透明:所有的题目和评分标准都公开了,就像把考卷和答案都贴在墙上,让全世界的研究者都能来研究 AI 到底哪里不行,从而改进它。
总结
COMPOSITE-STEM 就像给 AI 发了一张“实习工牌”,把它扔进一个模拟的“科学实验室”里干活。
目前的结论是:AI 还很年轻,虽然它们背熟了书本,但在真正动手解决复杂的科学问题时,还像个刚入行的实习生,经常手忙脚乱,离成为“科学家助手”还有很长的路要走。
这篇论文的价值在于,它不再问"AI 知道多少知识”,而是问"AI 能解决多少实际问题”,为未来 AI 真正融入科学研究设立了新的标杆。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。