← 最新论文
💬 NLP

Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context

本文提出了名为 LiveIdeaBench 的新基准,通过单关键词提示评估大语言模型在五个维度上的科学发散性思维与创意生成能力,研究发现该能力与通用智能指标相关性较弱,表明科学创意生成需要专门的评估体系及差异化的训练策略。

原作者: Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

发布于 2026-02-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)举办一场特殊的"科学头脑风暴大赛"。

为了让你更容易理解,我们可以把这项研究想象成在测试一群“超级天才”的发散性思维能力,而不是他们做数学题或背单词的能力。

1. 核心问题:聪明不等于有创意

想象一下,你有一个非常聪明的学生(比如一个智商极高的 AI),他能解出世界上最难的微积分题,也能背诵整本百科全书。但是,如果你给他一个词,比如“苹果”,问他:“你能想到多少种关于苹果的全新科学点子?”

  • 传统测试(收敛性思维):问“苹果从树上掉下来是因为什么?”(答案唯一:万有引力)。这测的是逻辑和知识
  • 这篇论文测的(发散性思维):问“关于苹果,你能提出什么以前没人想过的科学实验?”(比如:用苹果皮做生物电池?研究苹果腐烂时的声波?)。这测的是创意和想象力

作者发现,一个模型在“做数学题”上很厉害,并不代表它在“想新点子”上也很厉害。就像有的画家画画很绝,但未必擅长修钟表。

2. 他们是怎么测试的?(LiveIdeaBench 大赛)

作者设计了一个叫 LiveIdeaBench 的评测系统,就像是一个不断更新的“创意竞技场”:

  • 题目极简:不像以前的考试给一大段背景材料,这次只给一个关键词(比如“量子力学”、“细菌”、“交通”)。这就像给画家只给了一张白纸和一支笔,看他能画出什么。
  • 评委阵容:他们找来了 40 多个最顶尖的 AI 模型(包括 GPT-4, Claude, DeepSeek, Qwen 等)来当“生成者”。
  • 裁判团:为了公平,他们又选出了 10 个最强的 AI 模型当“裁判”。这些裁判会像《Nature》或《Science》杂志的审稿人一样,从五个维度打分:
    1. 原创性:点子够不够新?(是不是陈词滥调?)
    2. 可行性:这个点子真的能做成吗?(还是天方夜谭?)
    3. 清晰度:说得清楚吗?(能不能让人听懂?)
    4. 流畅度:能不能一口气想出很多不同的点子?(是不是只会重复一种?)
    5. 灵活性:换个领域(比如从物理换到生物),它还能保持高水平吗?

3. 令人惊讶的发现

比赛结果揭示了一些反直觉的真相:

  • “偏科”现象严重

    • 有些模型(如 claude-3.7-sonnet:thinking)是“全能学霸”,既擅长解题,又擅长想点子。
    • 但有些模型(如 QwQ-32B-preview)是“偏科天才”。它在通用智力测试(做数学、写代码)中排名靠后,但在科学创意方面却能和顶级学霸打得有来有回!
    • 这说明:通用智商高 \neq 科学创意强。就像一个数学奥林匹克冠军,不一定能写出最棒的科幻小说。
  • 字数不是王道

    • 很多人以为 AI 想得越多、写的越长,点子就越好。但研究发现,想法的长度和它的质量几乎没有关系。有时候,简短的一句话反而比长篇大论更有创意。
  • 不同模型有不同特长

    • 有的模型特别擅长“天马行空”(原创性高),但点子可能有点不切实际。
    • 有的模型特别擅长“脚踏实地”(可行性高),但点子可能比较保守。
    • 这就像组建一个科研团队,你需要一个“疯狂科学家”来提想法,也需要一个“严谨工程师”来落地执行。

4. 这对我们意味着什么?

这项研究告诉我们,未来的 AI 发展不能只盯着“让它更聪明(做更多题)”这一条路。

  • 需要专门的训练:如果想让 AI 帮人类做科学发现,可能需要专门训练它的“发散思维”能力,而不是只让它刷题。
  • 人机协作的新模式:未来的科学实验室里,可能会是这样分工的:
    • 人类科学家负责提出大方向和伦理把关。
    • 高创意 AI 负责像“喷气式飞机”一样,瞬间产生几百个疯狂的假设。
    • 高可行性 AI 负责像“过滤器”一样,把这些假设筛选成可执行的实验方案。

总结

这篇论文就像是在告诉 AI 开发者:“别只盯着 AI 的智商分数看了,它的‘脑洞’大小才是科学创新的关键!” 他们开发了一个新的尺子(LiveIdeaBench),专门用来衡量 AI 能不能像人类科学家一样,从简单的线索中迸发出改变世界的火花。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →