← 最新论文
💬 NLP

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

该论文提出了首个名为 ResearchBench 的大规模基准,旨在通过灵感检索、假设构建和假设排序等子任务评估大语言模型在科学发现中的能力,并利用 2024 年后的最新文献构建自动化框架以确保数据无污染,评估结果显示模型在跨学科灵感检索方面表现优异。

原作者: Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ResearchBench 的新工具,它的核心目的是给大语言模型(LLM)做一场“科学发现”的期末考试

想象一下,现在的 AI 就像是一个读过全世界所有书籍的“超级学霸”,但它能不能像真正的科学家一样,凭空想出一个全新的、有价值的科学假设呢?以前没人知道,因为缺乏一个专门的考试来测试它。这篇论文就是为了解决这个问题。

为了让你更容易理解,我们可以把科学发现的过程想象成做一道绝世美味的新菜

1. 科学发现的“三步走”策略

作者认为,科学家发明新理论(比如“反向传播算法”)并不是靠魔法,而是靠三个步骤。这就好比厨师做菜:

  • 第一步:找灵感(Inspiration Retrieval)

    • 比喻:厨师想做一个新菜,但他手里只有“红烧肉”的菜谱(研究背景)。他需要去别的菜系(比如去翻翻“意大利面”或“分子料理”的书)找灵感。
    • AI 的任务:给 AI 一个科学问题(比如“怎么让手机电池更耐用?”),让它从海量的文献中,找出那些看起来跟电池没关系,但能带来启发的“跨界”知识(比如“生物细胞膜的结构”)。
    • 论文发现:AI 非常擅长这一步!它像个拥有“第六感”的寻宝猎人,能发现人类科学家容易忽略的、看似不相关的知识之间的联系。
  • 第二步:写菜谱(Hypothesis Composition)

    • 比喻:找到了灵感(比如“细胞膜”),厨师要把“红烧肉”的技法(背景)和“细胞膜”的结构(灵感)结合起来,构思出一道新菜(新假设)。
    • AI 的任务:把找到的灵感和背景知识融合,写出具体的科学假设。
    • 论文发现:AI 能写出像模像样的“菜谱”,但有时候味道(逻辑深度)还不够完美,有点像“形似神不似”。
  • 第三步:试菜排名(Hypothesis Ranking)

    • 比喻:厨师做了好几个新菜,需要请美食家来品尝,选出最好吃的那一道。
    • AI 的任务:在 AI 自己生成的很多假设中,挑出最靠谱、最有科学价值的那一个。
    • 论文发现:这一步 AI 表现一般,而且有个毛病——它喜欢“先入为主”。如果第一个菜放在它面前,它总觉得第一个更好,哪怕第二个其实更好(这叫“位置偏见”)。

2. 这个“考试”是怎么设计的?

为了公平起见,作者设计了一套非常聪明的考试系统:

  • 考的是“新鲜”知识:他们只选了 2024 年及以后 发表的 1386 篇顶级科学论文(来自《Nature》、《Science》等)。
    • 为什么? 因为现在的 AI 训练数据通常截止到 2023 年或更早。用 2024 年的新题考它,就能确保它不是靠“死记硬背”背答案,而是真的在“思考”。
  • 自动出题:作者开发了一个 AI 助手,自动把论文拆解成“研究问题”、“背景”、“灵感来源”和“最终假设”。
    • 比喻:就像有一个自动阅卷机器,把复杂的科学论文拆解成“填空题”和“选择题”,让大模型来回答。
  • 专家监考:请了 5 位真正的博士(物理、化学、天文等专家)来检查这个自动拆解系统准不准。结果显示,准确率高达 90% 以上,说明这套考题是靠谱的。

3. 考试结果如何?

  • 惊喜:AI 在找灵感(第一步)上表现惊人。即使题目很难(比如要在 100 个选项里只选 4 个最对的),AI 也能选对 40% 以上。这说明 AI 真的能理解不同学科之间隐秘的联系。
  • 不足:在写假设排排名上,AI 还需要努力。它有时候会把两个东西生硬地拼在一起,或者因为“先入为主”而选错最好的方案。
  • 规模效应:论文发现,模型越大(参数越多),在“排排名”这一步提升越明显;但在“找灵感”这一步,到了某个大小后提升就不明显了。

4. 这篇论文意味着什么?

作者提出了一个有趣的观点:未来的 AI 可以成为科学家的“灵感矿场”(Research Hypothesis Mines)。

  • 比喻
    • AI 是矿场:它里面藏着无数种可能的科学想法。
    • 更强的模型 = 更丰富的矿藏:模型越强,能挖出的好点子越多。
    • 更多的算力 = 更多的矿工:投入更多计算资源,就能从矿场里挖掘出更多高质量的假设。

总结一下:
这篇论文告诉我们,AI 已经不再是只会写写代码、聊聊天的小助手了。它开始展现出像科学家一样“跨界思考”的潜力。虽然它现在还不能完全替代人类科学家(毕竟它还会犯“先入为主”的错误),但它已经是一个超级强大的科研副驾驶,能帮人类在茫茫书海中快速找到那些意想不到的灵感火花。

只要给 AI 更多的算力和更好的训练,未来它或许能帮我们自动发现下一个“诺贝尔奖级”的科学理论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →