SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
本文介绍了 SciArena,这是一个由社区驱动的评估平台,它利用人类研究人员的投票,对在开放式、基于文献的科学任务上的基础模型进行排名,同时发布了 SciArena-Eval,这是一个旨在评估自动化评估系统相对于人类偏好之准确性的元基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场规模宏大、高风险的科学才艺表演赛,参赛者不是歌手或舞者,而是试图回答复杂研究问题的 AI 机器人。这就是 SciArena,一个由耶鲁大学、纽约大学和艾伦人工智能研究所(Allen Institute for AI)的研究人员创建的新平台。
以下是其运作方式的拆解,通过简单的概念进行说明:
1. 问题所在:“图书馆”太大了
当今的科学家正淹没在信息海洋中。每天都有新的研究论文发表,人类不可能阅读所有内容。他们需要帮助来总结并从这个巨大的图书馆中寻找答案。AI 在这方面很擅长,但我们如何知道哪一个 AI 才是最优秀的“图书管理员”呢?
传统的测试就像是多项选择题。它们是静态的,往往在发布时就已经过时了,而且无法捕捉到科学研究中那种混乱且真实的复杂性。
2. 解决方案:科学界的“盲测”
SciArena 采取了不同的方法,其灵感来自广受欢迎的“Chatbot Arena”。你可以把它想象成一场针对咖啡或葡萄酒的盲测,只不过这次的对象是科学答案。
- 设置: 一位人类研究员提出一个真实的、开放式的问题(例如:“量子计算领域的最新突破是什么?”)。
- 检索: 系统不仅仅让 AI 进行猜测。它首先会前往一个庞大的数字图书馆(包含超过 1 亿篇论文)来寻找最相关的文档。它将这些文档交给两个不同的 AI 模型。
- 竞赛: 这两个 AI 根据这些文档编写详细的长篇回答,并附带引用(类似于脚注)。
- 投票: 人类研究员在不知道哪个 AI 撰写了哪个答案的情况下阅读两个答案。他们投票给那个更有帮助、更准确且表达更好的答案。
3. 计分板:“Elo”等级分
每当一个 AI 赢得一次投票,它就会获得积分。如果输了,它就会失去积分。这被称为 Elo 等级分系统(与用于对人类进行排名的方法相同,常用于国际象棋选手排名)。
- 在 8 个月的时间里,该平台收集了来自各个领域的 20,000 张选票(涵盖医学到工程学等领域)。
- 结果是一个排行榜。目前,厨房里最顶尖的“厨师”是名为 o3、Claude-4.1-Opus 和 GPT-5 的模型。
4. “评委的评委”:SciArena-Eval
研究人员意识到,要求人类进行投票既昂贵又缓慢。他们想知道:AI 能否判断另一个 AI 回答的质量?
为了测试这一点,他们构建了一个新的基准测试,名为 SciArena-Eval。他们提取了人类的投票数据,并要求各种 AI 模型充当评委,在两个答案之间选出胜者。
- 结果: 即便是最聪明的 AI 评委,与人类专家相比,正确率也仅为 65% 左右。
- 比喻: 这就像是请一位美食评论家去猜,在两道菜肴中,专业厨师会更倾向于哪一道。即使是最优秀的评论家,也会在三分之一的情况下猜错。这证明了评判科学答案是极其困难的,即便对于 AI 也是如此。
5. 关键发现与游戏规则
论文强调了 AI 和人类行为的一些有趣特征:
- 引用很重要(但质量重于数量): 在其他一些 AI 测试中,人们仅仅因为答案中有更多的脚注就喜欢它,即便这些脚注是错误的。但在 SciArena 中,科学家们更加聪明。他们更倾向于那些脚注确实能支持论点的答案。如果一个 AI 编造了虚假的关联,科学家会投反对票。
- 拒绝“花哨”: 研究人员确保了 AI 不会通过使用华丽的格式(如加粗文本、表情符号或项目符号)来获胜。他们剥离了所有这些元素,以确保投票是基于内容而非风格。
- “最佳”模型: 研究发现 o3 模型是最稳定的获胜者。它擅长清晰地解释复杂概念,使用精准的科学语言,并能逻辑严密地组织信息。
总结
SciArena 是一个由社区驱动的竞技场,在这里,真正的科学家通过投票来决定哪一个 AI 最擅长阅读和理解科学文献。它证明了虽然 AI 正在变得越来越好,但要完美取代人类专家来评判复杂的科学工作,仍有很长的路要走。该平台、数据以及“评委的评委”基准测试都是向所有人开放的,旨在帮助构建更好的 AI 工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。