← 最新论文
💬 NLP

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

本文提出了名为 ScienceBoard 的多模态自主智能体评估框架,通过构建包含专业软件的跨学科真实科学工作流环境及 169 个高质量基准任务,揭示了当前顶尖智能体在复杂科研任务中仅 15% 的成功率,并指出了其局限性及未来改进方向。

原作者: Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhaoyang Liu, Jianing Wang, Qintong Li, Xiangru Tang, Tianbao Xie, Xiachong Feng, Xi
发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhaoyang Liu, Jianing Wang, Qintong Li, Xiangru Tang, Tianbao Xie, Xiachong Feng, Xiang Li, Ben Kao, Wenhai Wang, Biqing Qi, Lingpeng Kong, Zhiyong Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 SCIENCEBOARD 的新项目,你可以把它想象成给人工智能(AI)科学家举办的一场"超级硬核的期末大考"。

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这篇论文的核心内容:

1. 背景:AI 想当“科研助手”,但还在“新手村”

现在的 AI(大语言模型)很聪明,能写诗、写代码、回答问题。科学家们希望它们能像真人助手一样,坐在电脑前,自己打开软件、点鼠标、敲键盘,帮自己做复杂的实验(比如分析蛋白质结构、模拟天体运行)。

但是,目前的 AI 就像是一个刚拿到驾照的“理论派”司机。它背熟了所有交通规则(知识),但真让它上路(操作复杂的科学软件),它可能会把油门当刹车,或者找不到路。

2. SCIENCEBOARD 是什么?一个“全真模拟的科研驾校”

为了测试 AI 到底能不能当科研助手,作者们搭建了一个SCIENCEBOARD

  • 它不是简单的问答题:以前的考试是问"1+1 等于几?”,AI 答对就行。
  • 它是真实的“操作模拟”:SCIENCEBOARD 就像是一个虚拟的实验室。里面安装了各种专业的科学软件(比如看星星的 Celestia、分析蛋白质的 ChimeraX、画地图的 GrassGIS 等)。
  • 考试规则:AI 必须像人一样,通过鼠标点击(GUI)或者命令行输入(CLI)来操作这些软件,完成具体的任务。比如:“请帮我把太阳系里所有行星的轨道显示出来”或者“请预测这个蛋白质的结构”。

比喻:以前的考试是让你“描述怎么开车”,现在的 SCIENCEBOARD 是直接把车钥匙扔给你,让你真的去把车开进车库

3. 考试内容:六大领域的“魔鬼训练”

这个考试涵盖了 6 个不同的科学领域,就像驾校的 6 个不同科目:

  1. 生物化学:像给蛋白质“做 CT 扫描”。
  2. 代数:像用计算器解复杂的数学题。
  3. 定理证明:像做逻辑严密的数学证明题。
  4. 地理信息系统:像分析地形图和水流。
  5. 天文学:像在虚拟宇宙里找星星、看日食。
  6. 科学文档:像写实验报告。

总共设计了 169 道 高难度题目,由人类专家精心编写,确保它们真实反映科学家日常遇到的麻烦。

4. 考试成绩:AI 们“挂科”了

作者们找来了目前世界上最强大的 AI 模型(比如 GPT-5, Gemini-2.5 等)来参加考试。结果令人震惊:

  • 人类专家:如果让真人来做,平均能拿到 60% 以上的分数。
  • 最强 AI:即使是目前最顶尖的 AI,平均成功率也只有 20% 左右。
  • 惨状:在很多复杂的任务中,AI 的成功率甚至接近 0%

比喻:这就好比让一群“学霸”去考“驾照科目二”,结果大部分人都倒在了“倒车入库”或者“侧方停车”上,连车都开不起来。

5. 为什么 AI 会失败?

论文深入分析了原因,发现主要有两个“死穴”:

  1. 眼手不协调(感知与行动脱节):AI 可能看懂了题目,但不知道鼠标该点哪里。科学软件界面很复杂,AI 经常点错按钮,或者找不到隐藏的菜单。
  2. 缺乏领域常识:AI 虽然读过很多书,但它不懂“行话”。比如在地理软件里,它不知道哪个按钮是“加载地图”,在天文软件里不知道如何调整时间。它就像一个懂很多理论但没进过实验室的研究生,面对仪器手足无措。

6. 未来的方向:需要“特种部队”

既然单个 AI 搞不定,作者们提出了一些改进思路:

  • 分工合作:让一个 AI 负责“想”(制定计划),另一个 AI 负责“做”(操作鼠标)。就像指挥官特种兵配合。
  • 多模态结合:既要能看懂屏幕(视觉),又要能看懂代码(文本),还要能灵活切换。

总结

这篇论文的核心思想是:AI 想要真正帮科学家做研究,光靠“聪明”是不够的,还需要学会“动手”。

SCIENCEBOARD 就像一面镜子,照出了当前 AI 在实际操作能力上的巨大短板。虽然现在的 AI 还远不能替代科学家,但这个测试平台为未来的改进指明了方向——我们需要训练出不仅能“思考”,还能像人类一样熟练“操作电脑”的全能型 AI 科研助手

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →