← 最新论文
💬 NLP

CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

本文介绍了 CreativityPrism,这是一个可扩展的跨领域评估框架,通过三个维度(质量、新颖性和多样性)对大型语言模型在发散性思维、创意写作和逻辑推理方面的八项任务进行评估,结果表明,尽管前沿模型在写作和推理方面表现出色,但在发散性思维方面并未显示出显著优势,且其性能很少能在不同的创意维度之间进行泛化。

原作者: Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、充满魔力的文本生成器(大语言模型,简称 LLM)图书馆。每个人都在问:“这些机器真的具有创造力吗?”

问题在于,“创造力”是一个难以捉摸的概念。有时它意味着写一个有趣的故事,有时意味着以一种奇特的方式解决数学问题,有时又意味着想到一个纸夹的新用途。在这篇论文发表之前,研究人员试图用不同的尺子来衡量不同领域的创造力,或者要求人类对每一个答案进行评分,但这既缓慢又昂贵。

“CreativityPrism”(创造力棱镜)登场了。

CreativityPrism 想象成一个高科技的棱镜,你将一束光(AI 的输出)投射进去。你看到的不再仅仅是一个白色的光团,而是通过棱镜将其分解成三种截然不同的颜色,从而揭示出机器创造力的真实本质。

创造力的三种颜色

作者认为,要真正理解一台机器是否具有创造力,必须从三个特定的维度进行衡量:

  1. 质量(“它管用吗?”这一色调): 这是基础。如果一台机器写的文章逻辑不通,或者解出的数学题是错误的,那么无论它的想法多么“新颖”,都毫无意义。那只是噪音。质量衡量的是输出是否真正完成了任务。
  2. 新颖性(“它有多怪异?”这一色调): 这衡量了答案偏离平凡程度的远近。这台机器是否提出了人类从未见过的解决方案?还是仅仅复制了其训练数据中的内容?
  3. 多样性(“有多少种选择?”这一色调): 这衡量的是广度。如果你要求机器提供 10 个想法,它是提供了 10 个完全不同的想法,还是仅仅提供了 10 个略有差异的版本?

类比: 想象一位厨师。

  • 质量: 食物味道好,没有烧焦。
  • 新颖性: 厨师发明了一种从未有人尝试过的口味组合(例如巧克力配酸黄瓜)。
  • 多样性: 厨师可以制作 10 种不同类型的甜点,而不只是 10 种不同版本的巧克力蛋糕。
  • CreativityPrism 会同时检查这三项。一个能做出 100 种不同版本的烧焦巧克力蛋糕的厨师,虽然多样性很高,但质量和新颖性都很低。

大考:17 位厨房里的主厨

作者选取了目前最智能的 17 个 AI 模型(来自 OpenAI、Google、Anthropic 和 DeepSeek 等公司),让他们接受 8 种不同挑战,涵盖三个领域:

  • 发散性思维: 类似于“替代用途测试”(例如:“除了盖墙,砖块还能用来做什么?”)。
  • 创意写作: 根据提示词编写故事或诗歌。
  • 逻辑推理: 在严格且奇特的约束条件下解决数学问题或编写代码。

他们的发现(剧情反转)

1. “大模型 vs 小模型”的差距
那些规模巨大、造价昂贵的 AI 模型(“前沿”模型)通常在创意写作逻辑推理方面表现更好。它们就像大师级的厨师,能够遵循复杂的食谱并编写精美的菜单。然而,在涉及发散性思维(提出天马行空、不相关想法)时,这些超级昂贵的模型与较小的开源模型之间的差距几乎消失了。大模型在“跳出框架思考”方面并不一定比小模型更擅长。

2. “专家”难题
这里是最令人惊讶的发现:擅长一种类型的创造力,并不意味着擅长另一种。

  • 一个模型可能非常擅长写小说(高质量),但在提出勺子的奇特用途方面却表现糟糕(低新颖性)。
  • 一个模型可能会生成 1,000 个不同的答案(高多样性),但其中没有一个是真正新颖或有用的(低新颖性)。

作者发现,“新颖性”是最具混沌性的维度。仅仅因为一个模型在数学问题中表现出“新颖”,并不意味着它在写故事时也会表现得“新颖”。它们是完全不同的技能。

3. “裁判”方案
由于人类评分速度太慢,无法完成所有测试,作者使用了一个聪明的技巧:他们利用其他的 AI 来对答案进行评分。但他们并没有盲目信任这些 AI。他们先让人类专家对一小部分样本进行评分,以确保“AI 裁判”确实与人类的判断一致。这就像是让主厨先品尝几道菜,以确保副厨们在对整个厨房进行评分时是准确无误的。

核心结论

CreativityPrism 是一个全新的工具,它让我们不再仅仅用“这个 AI 很有创造力”这样一个模糊且单一的说法来描述它。相反,它会告诉我们:“这个 AI 非常擅长写出高质量的故事,在创造性解决数学问题方面表现尚可,但在提出天马行空的无关想法方面表现不佳。”

它证明了创造力并不是一种单一的超能力;它是一系列并不总是同步出现的不同技能的集合。为了构建真正的创造性机器,我们需要针对这些不同的“颜色”进行专门训练,而不是仅仅寄希望于它们能偶然间把所有事情都做对。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →