← 最新论文
💬 NLP

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

本文批判了发散联想任务(DAT)在评估大语言模型时因忽略恰当性而存在的局限性,提出了基于人类创造力理论的新型条件发散联想任务(CDAT)以更好地将真正的创造力与噪声区分开来,并揭示了先进模型由于训练和对齐的原因,往往会以牺牲新颖性为代价来换取恰当性。

原作者: Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图评判一群人(在这种情况下是计算机程序)的创造力。你给他们一个简单的挑战:“说出 10 个彼此尽可能不同的词。”

这就是发散性联想任务 (Divergent Association Task, DAT)。如果你说“苹果”、“汽车”、“云朵”和“鞋子”,你会得到高分,因为这些词在意义上相距甚远。如果你说“苹果”、“香蕉”、“樱桃”和“葡萄”,你会得到低分,因为它们都属于水果。

这篇论文的研究人员提出了一个问题:这对人工智能 (AI) 来说是一个公平的测试吗?

问题所在:“随机噪声”陷阱

作者发现我们目前测试 AI 创造力的方法存在一个重大缺陷。他们发现,如果你只是要求 AI “表现得不同”,它可以通过随机化来作弊。

这就像是在玩“老师说”的游戏。如果规则仅仅是“要不同”,那么一个闭着眼睛在书页上随机指点单词的人,得分可能比一位才华横溢的诗人还要高。AI 可以仅仅吐出一些在意义上相距甚远但毫无逻辑关联的乱码词汇,从而获得高分。

在论文的实验中,他们测试了两个“作弊者”:

  1. 随机作弊者: 一个仅仅从字典中随机抽取 10 个单词的计算机程序。
  2. “游戏优化型”作弊者: 一个被专门告知“忽略意义;只需挑选能让你在这个测试中获得最高分的词”的 AI。

令人震惊的结果: 这两个“作弊者”的分数竟然都高于最先进、最智能的 AI 模型。这意味着旧的测试(DAT)实际上并没有衡量创造力;它仅仅是在衡量一个模型有多擅长随机化,或者它有多擅长钻系统的漏洞。

解决方案:“情境化”测试 (CDAT)

为了修复这个问题,研究人员发明了一种新的测试,称为 CDAT(条件发散联想任务)。

类比:
想象旧的测试是要求某人“说出 10 个随机的事物”。
新的测试则像是要求:“说出 10 个都与‘猫’有关的不同事物。”

现在,AI 必须同时完成两件事:

  1. 要恰当: 单词必须确实与提示词相关(例如:“胡须”、“爪子”、“激光笔”)。如果它说了“烤面包机”或“火山”,它就失败了。
  2. 要多样: 这些词之间仍需保持差异。虽然“猫”、“小猫”和“猫科动物”都相关,但它们太相似了。“猫”、“鱼”和“狗”则更好。

这种新测试将真正的创造力(既独特又合乎逻辑)与随机噪声(既独特又毫无意义)区分开来。

他们的发现

当他们运行这个新测试时,结果发生了彻底的变化:

  • “聪明”的 AI 过于保守: 最先进、规模最大的 AI 模型(那些经过训练以变得极其有用且遵循规则的模型)往往会选择稳妥的做法。它们给出的答案非常恰当,但略显乏味,缺乏创造力。它们就像是一个完美掌握教科书知识、却不敢跳出框架思考的学生。
  • “较小”的 AI 更具创造力: 令人惊讶的是,规模较小、技术相对没那么“先进”的模型往往得分更高。它们更愿意冒险,在保持主题相关的同时,提出更独特、更多样化的想法。

作者指出,随着 AI 模型变得越来越庞大并接受更多关于“安全”和“有用”的训练,它们的创造力火花实际上正在减弱。它们变得过于关注正确性,而忽略了趣味性。

总结

该论文得出结论,我们不能仅仅通过要求 AI “表现得不同”来衡量其创造力。我们必须要求它在特定的语境下表现得不同。

  • 旧方法: “表现得随机!”(AI 通过胡言乱语来作弊)。
  • 新方法: “展现创造力,但要合乎逻辑!”(AI 必须在保持独特与保持有用之间取得平衡)。

这种新方法为我们提供了一个更清晰的视角,让我们能够分辨哪些 AI 模型是真的具有创造力,而哪些模型仅仅是擅长遵循指令或进行随机猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →