← 最新论文
💬 NLP

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

本研究表明,多模态大语言模型能够在零样本设置下有效地评估视觉创造力,并与人类评分保持高度一致,同时尽管其逐步推理过程并未提高评分准确性,却能为评估过程提供具有解释性的见解。

原作者: William Orwig, Roger E. Beaty

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: William Orwig, Roger E. Beaty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你面前坐着一位巨大的、超级聪明的艺术评论家。他从未上过艺术课,从未见过人类给画作打分,也从未被告知“创造力”长什么样。你只是把一张图片递给他,然后问:“在1到5分的范围内,这张图的创造力是多少?”

这本质上就是这篇论文所做的事情。研究人员要求六个不同的高级人工智能模型(把它们想象成不同的“数字评委”)去做这件事。他们想看看这些AI是否能在没有任何专门训练或练习的情况下,猜出人类会对图片的创造力给出怎样的评分。

以下是他们发现的故事,分为几个简单的部分:

1. “零样本”(Zero-Shot)魔术

通常情况下,要教会一个AI去评价艺术,你必须向它展示数千个带有人类评分的“好”画作和“坏”画作的例子。这就像通过给学生看一叠批改过的试卷来教导他们一样。

但这些研究人员尝试了另一种方法:零样本(Zero-Shot)。他们只给了AI一张图片和一个简单的指令:“请按1到5分进行评分。”没有例子,没有训练。这就像是在问一个从未见过那幅画的街头陌生人,请给那幅画打分。

结果: 出人意料的是,AI评委做得相当不错。它们的评分与人类的评分吻合得很好。

  • 对于AI生成的图像(由计算机制作的精美图片),AI评委与人类的意见高度一致。
  • 对于手绘草图(人类绘制的粗糙、凌乱的画作),这种一致性依然存在,但稍弱一些。

2. “精致 vs 粗糙”的偏见

研究人员注意到这些AI评委有一种有趣的性格缺陷,就像一个热爱高清晰度照片但讨厌铅笔素描的评论家。

  • “精致”偏见: 在观察光滑的计算机生成图像时,AI评委表现得过于慷慨。它们给出的分数比人类给出的要高。
  • “粗糙”偏见: 在观察简单的手绘草图时,AI评委则显得过于严苛。它们给出的分数比人类给出的要低。

看起来,AI模型在内心深处喜欢“复杂”和“精细”的图像。如果一幅画有很多线条和细节,AI就会认为它很有创造力,即便人类评委认为它只是“过于繁琐”。AI模型似乎将“细节丰富”与“创造力”混淆了。

3. “思维过程”(思维链)

其中一些AI模型有一个特殊功能:在给出最终分数之前,它们会写出自己的“思维过程”。这就像学生在数学考试中展示解题步骤一样。

研究人员窥探了这些思维过程,以观察AI是如何决定评分的。他们发现AI遵循一个一致的四步配方:

  1. 感知: “我看到一只猫和一棵树。”(描述那里有什么)。
  2. 原创性: “这很奇特且新颖!”(判断其是否独特)。
  3. 质量: “线条很平滑且漂亮。”(判断画得有多好)。
  4. 论证: “所以我给4分。”(挑选数字)。

大惊喜: 研究人员原本以为,如果AI花时间去“思考”并写出这些步骤,它的评分会变得更准确,从而更接近人类的评分。事实并非如此。 “思考”并没有让分数变得更准确。然而,它为研究人员提供了一个窗口,让他们了解AI给出该分数的原因。它显示出AI更多是在关注“质量”(即画得有多美),而不仅仅是“原创性”(即有多奇特),这也解释了为什么它们如此喜爱那些精致的AI图像。

4. AI需要知道它在看什么吗?

研究人员想知道:“如果AI把画里的一只狗误认为是猫,它的创造力评分会下降吗?”

答案是: 不会。
即使当AI错误识别了画中的物体,或者当画作过于抽象以至于人类都无法就它是什么达成共识时,AI的创造力评分仍然能很好地匹配人类的评分。这表明AI并不是仅仅在核对一份清单(比如“这是狗吗?是/否”)。它是在观察图像的“神韵”、构图和奇特性,即使它并不完全确定那个物体到底是什么。

总结

这篇论文表明,我们可以直接使用这些大型通用AI模型作为“创造力评委”,而无需预先对其进行训练。它们表现得相当出色,但存在一种偏见:它们喜欢复杂的、细节丰富的图像,而讨厌简单的、粗糙的草图。

通过观察它们的“思维过程”,我们可以清楚地看到它们在哪些地方做得对,以及在哪些地方出错。这就像拥有一个能够解释其推理逻辑的评论家,即便他们的品味与我们略有不同。研究人员甚至开发了一个免费的应用,让任何人都可以尝试用这个“AI评委”来评价自己的作品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →