← 最新论文
💬 NLP

Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations

本文批判性地分析了跨多个领域的四种常见创造力评估指标,揭示了它们显著的不一致性、领域特定局限性以及与人类判断的脱节,从而强调了对更具鲁棒性和泛化性框架的迫切需求。

原作者: Li-Chun Lu, Miri Liu, Pin-Chun Lu, Yufei Tian, Shao-Hua Sun, Nanyun Peng

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Li-Chun Lu, Miri Liu, Pin-Chun Lu, Yufei Tian, Shao-Hua Sun, Nanyun Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图寻找世界上最具创造力的作家、问题解决者和科学家的星探。你面前有一大堆参赛作品,但你需要一种方法来快速将那些“天才”之作与“平庸”之作区分开来。由于作品太多,无法人工阅读,于是你决定使用四种不同的自动化工具(指标)来帮你进行筛选。

这篇论文本质上就是一份关于这些工具的成绩单。作者们测试了它们是否真的有效,而坏消息是:它们都相当不可靠。

以下是他们测试的四种工具及其失败原因的详细说明,使用了简单的类比:

测试的四种工具

1. “复制粘贴”检测器(创造力指数 / Creativity Index)

  • 工作原理: 该工具扫描互联网,查看某个句子是否曾经被写过。如果一个短语是独特的,且没有出现在其庞大的数据库中,它就会给出高“创造力”分数。
  • 问题所在: 这就像仅凭一位厨师使用了多少种别人从未买过的食材,来评判这位厨师的创造力。
    • 创意写作方面,它的表现还可以,因为独特的词汇往往意味着新鲜的故事。
    • 问题解决科学领域,它表现得极其糟糕。一个卓越的新科学构想可能会使用非常常见、标准的词汇(如“实验”或“数据”),因此这个工具会认为它很枯燥。相反,一位作家可能会为了显得高深而使用古怪、生僻的词汇,而这个工具却认为那是天才。它衡量的是词汇多样性,而非思想新颖度

2. “惊喜度计” (困惑度 / Perplexity)

  • 工作原理: 该工具预测计算机对句子中下一个词出现的“惊讶程度”。如果文本非常可预测,得分就低;如果文本很奇怪、出人意意料,得分就高。其核心理念是:创造力 = 惊喜感。
  • 问题所在: 这就像通过观众因困惑而发出的惊呼声,来评判一位喜剧演员。
    • 有时,一段文本得分很高(非常令人惊讶),仅仅是因为它的语法混乱或毫无意义,而不是因为它具有创造力。
    • 有时,一个真正精彩、清晰的观点读起来非常流畅且易于理解,因此该工具给出的分数很低。
    • 作者发现,“有创造力”和“无创造力”的文本往往会得到完全相同的分数,使得该工具无法用于区分两者。

3. “句子结构扫描仪”(句法模板 / Syntactic Templates)

  • 工作原理: 该工具观察句子的骨架(例如,“名词 + 动词 + 形容词 + 名词”)。它检查作者是否反复使用相同的句子模式。
  • 问题所在: 这就像仅通过画家的笔触形状,来评判一位画家,却忽略了他们正在画的画作本身。
    • 创意写作中,它捕捉到了 AI 经常使用的重复、公式化的句子结构(例如,“英雄之旅始于……”)。
    • 然而,在科学问题解决领域,专家们往往需要使用标准、公式化的语言来确保清晰和精准。这个工具因为他们遵循了语法规则而惩罚了他们,认为他们缺乏创造力。

4. “AI 裁判”(大语言模型作为裁判 / LLM-as-a-Judge)

  • 工作原理: 使用另一个 AI 来阅读作品并给出评分,就像人类老师批改作业一样。
  • 问题所在: 这就像雇佣一名学生来给另一名学生的作业打分。他们表现得不稳定且容易被误导。
    • 可挤压性(Squeezable): 如果你稍微改变提问方式(例如,问“这是有创造力的吗?”对比“这是否没有创造力?”),AI 会完全改变主意。
    • 偏见: 它倾向于选择一边倒(例如,无论实际质量如何,总是说“不,这没有创造力”)。
    • 不可靠: 当被要求对同一篇论文进行三次评分时,它只有 40% 的时间能与自己保持一致。它基本上是在瞎猜。

大局观

作者在三种不同类型的创造力上测试了这些工具:

  1. 创意写作(故事、诗歌)。
  2. 问题解决(寻找使用日常物品的奇特方法)。
  3. 研究构思(提出新的科学理论)。

结果: 没有单一的工具适用于所有三种情况。一个擅长识别创意故事的工具,在识别创意科学构想时却表现得很差。有时,针对同一篇文本,这些工具甚至会对结果产生分歧。

结论

论文得出结论:我们目前还没有一种可靠的方法来自动衡量真正的创造力。

  • 现有的工具大多是在衡量表层事物,如词汇选择、句子长度或文本看起来有多“奇怪”。
  • 它们无法衡量文本背后的实际想法概念
  • 仅仅因为计算机基于这些数字判定某物是“有创造力的”,并不意味着人类也会认同。

作者本质上是在说:“我们需要停止依赖这些简单的数学技巧。在我们可以信任它们去评判人类(或机器)的创造力之前,我们需要构建更好的系统,这些系统要能理解思想,而不只是单词。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →