Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery
科学边缘评估(SEE)基准测试表明,当前的跨模态大语言模型在从化学、生物学和材料科学的实验数据中可靠地推导出基于证据的见解方面仍存在困难,即使在使用了工具的情况下,其准确率最高也仅为 52.7%,这凸显了在解释既定概念与进行真正的科学发现之间存在的关键差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解谜题的侦探,但你不仅仅是阅读一份证人陈述,而是必须同时观察一张模糊的照片、一个指纹、一个化学测试结果和一张撕碎的地图。这才是真正的科学发现带给人的感觉。科学家们并不只是背诵教科书上的事实;他们必须观察混乱的、现实世界中的数据——比如微小细胞的图像、来自机器的曲线图、以及实验中的数字——并弄清楚究竟发生了什么。他们必须非常谨慎,不能根据自己“认为”应该发生的情况进行猜测,而只能基于证据“实际”显示的内容进行判断。
长期以来,我们一直在测试被称为“大语言模型”(LLMs)的“计算机大脑”,看看它们是否足够聪明,能够协助这种侦探工作。这些就是那些可以写故事或回答常识问题的同类 AI。但有一个巨大的疑问:它们能否处理实验室中那种混乱、视觉化且复杂的现实情况?如果一个 AI 要帮助科学家发现新药或新材料,它就不能仅仅是一个“演说家”,它必须是一个优秀的观察者,一个谨慎的思考者,并且知道何时该说:“我手头的线索还不够。”
伟大的实验室测试:AI 能“看懂”科学吗?
研究人员决定对这些“AI 侦探”进行终极测试。他们创建了一个新的挑战,叫做科学边缘评估(Science Edge Evaluation,简称 SEE)。把 SEE 想象成一场巨大的、难度极高的考试,它不会问你“法国的首都是哪里?”或者“水的分子式是什么?”,而是递给你一个真实的科学谜题:一张显微镜载玻片的照片、一张来自化学实验的图表,以及一个需要通过连接所有这些线索来找到答案的问题。
该考试涵盖了三大领域:化学(物质如何变化)、生物学(生命如何运作)以及材料科学(我们如何制造新东西)。问题源自真实的、已发表的科学论文和真实的实验室实验。考试共有 1,116 道题目,且设计得非常刁钻。有些要求 AI 从图表中读出一个特定的数值,有些要求它找出生物结构图中的错误,还有些则需要它将生物学和化学的知识结合起来。
测试结果:现实的检验
研究人员在这次考试中测试了 19 种不同的 AI 模型。其中包括那些最强大、最著名的“通用型”AI(那些无所不能的 AI),以及一些“科学专业型”AI(专门针对科学书籍进行训练的 AI)。
这里有一个巨大的惊喜:没有一个模型表现出色。
事实上,表现最好的模型是一个名为 GPT-5.6-Sol (Max) 的强力模型,它的正确率仅为 48.7%。这甚至不到一半!其他模型的表现更差,有些得分甚至低至 15.9%。这就像一个学生参加期末考试却只拿到了 D- 成绩。
更有趣的是,那些“科学专业型”模型(那些在科学课上刻苦学习的模型)平均表现竟然比“通用型”模型还要差。通用模型平均正确率为 34.9%,而科学专家模型的平均正确率仅为 22.2%。这表明,仅仅背诵大量的科学事实是不够的。AI 需要学会如何在观察混乱、真实的图像时去“使用”这些事实。
“工具”问题:计算器会有帮助吗?
研究人员想知道:“如果我们给 AI 一个计算器和搜索引擎会怎样呢?”他们让前六名的模型使用了工具,比如网页搜索(查找事实)和代码解释器(进行数学运算或分析图像)。
提供工具确实有所帮助,但提升并不大。表现最好的模型得分从 48.7% 提升到了 52.7%。虽然这是一个小幅度的进步,但仍然没有达到及格线。工具为 AI 提供了更多信息,但 AI 仍然难以判断哪些信息是重要的,以及如何将它们整合在一起。有时,这些工具甚至会让 AI 感到困惑,导致它选择了错误的路径,或者陷入过度思考的死循环。
核心问题:为什么它们会失败?
论文深入探讨了 为什么 AI 会失败。事实证明,问题不在于 AI 掌握的知识不够多,而在于 AI 很难坚持基于证据进行推理。
- “盲目猜测”的习惯: 当研究人员拿走图片,只给 AI 提供文本时,AI 并不会说:“嘿,没有这张图片我解决不了!”相反,它会根据以往读过的资料进行猜测。它试图利用记忆来破解谜题,而不是观察线索。事实上,AI 仅在 4.6% 的案例中承认自己缺少信息。
- 忽略图像: 如果图像显示了一些与 AI 预期不符的异常情况,AI 往往会忽略图像,转而相信自己的“直觉”(即它从训练数据中学到的内容)。这就像一名侦探因为指纹与嫌疑人的陈述不符,就选择无视指纹一样。
- 过度自信: AI 经常试图填补空白。如果一个实验是不完整的,AI 会编造出一个结论,仿佛它已经掌握了所有数据。真正的科学家知道,有时你确实无法得出结论,但 AI 太急于给出一个答案了。
缺失的一步
论文总结道,我们在让 AI 变得对科学有用方面,还缺少一个关键步骤。我们一直试图把 AI 教成一个图书馆(存储事实)或一个计算器(进行数学运算)。但真正的科学需要 AI 成为一名侦探——能够观察混乱的证据,承认自己不知道答案,并且只做出严格基于所见证据的结论。
作者们建议,要让 AI 真正助力科学发现,它需要学会更好地管理证据。它需要学会何时停止猜测,以及何时要求更多的数据。在 AI 能够做到这一点之前,它或许能成为写报告的好助手,但还没准备好亲自掌控实验室。从“了解事实”到“基于证据进行推理”之间的跨越,正是通往真正科学发现所缺失的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。