Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity
本文揭示了,尽管大语言模型(LLMs)在原创性等内在特质上与人类的创造力评估保持一致,但由于它们依赖于更窄的、模型特定的标准且对上下文信息不敏感,导致两者存在显著分歧,从而使得选择特定的 LLM 评估者成为创造力评估中一个具有重要影响的决策。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正置身于一座巨大且嘈杂的美术馆中,每个人都在试图猜测哪些画作是具有“创造力”的。有些人只看颜料和笔触;有些人则关注谁画了这幅画、它卖多少钱,或者它在当下是否流行。长期以来,人类一直是这座美术馆里唯一的评委。但现在,一种新型的评委来到了这里:大语言模型,或者叫 LLM。把 LLM 想象成一个超级聪明的机器人,它读过几乎所有的书籍、文章和网站。因为它了解人类所说的一切,我们曾希望它能像人类一样评判创造力。但谜题在于:有时这个机器人与我们的看法一致,有时它似乎在看另一幅完全不同的画。科学家们想知道,机器人在什么时候会像我们一样思考,又在什么时候会陷入自己的思维迷宫。这篇论文深入探讨了这个问题,旨在看看我们是否可以信任这些数字评委来为我们的创造力竞赛挑选出优胜者。
研究人员致力于找出这些机器人评委究竟遵循什么样的规则。他们不仅仅是问:“这有创造力吗?”而是要求机器人对人类通常关注的 26 种不同要素进行重要性排序,比如“它是新颖的吗?”、“它有用吗?”或者“它有名吗?”。他们测试了六个最流行的 LLM(GPT、Grok、DeepSeek、ERNIE、Claude 和 Gemini),并将它们的答案与真实人类的观点进行了对比。
以下是他们发现的一个大惊喜:这些机器人并不都以同样的方式思考,它们也不完全像我们一样思考。人类使用一张“大网”来捕捉创意——既看创意本身,也看周围的环境(例如它的声誉或市场趋势);而机器人则主要只看创意本身。具体来说,机器人对新颖性非常痴迷。如果一个想法是全新的、古怪的或出人意料的,机器人就会非常喜欢。它们也喜欢有趣或具有艺术感的东西。但当涉及到“语境性”线索时——比如一个产品是否来自知名品牌、是否是大众市场的热门产品,或是是否时尚——机器人基本上会忽略它们。对于人类来说,一个知名品牌可能会让一个想法看起来更有创造力;但对于机器人来说,那仅仅是噪音。
这项研究还发现,并非所有的机器人都是以同样的方式构建的。有些模型,如 GPT 和 Grok,拥有更“宽的网”。它们观察的 26 个人类标准更多,因此它们的判断与人类观点非常吻合。而另一些模型,如 Claude 和 Gemini,则拥有更“窄的网”。它们严格专注于核心创意,并忽略几乎其他所有事物。这意味着,如果你要求一个“窄网”机器人去评判一个创意,它可能会偏离人类的思路,仅仅因为它忽略了人类所关心的社会或市场背景。
为了证明这一点,研究人员又进行了两项测试。在第一项测试中,他们让参与人类和机器人共同评判 1,100 多个创意。他们发现,拥有“宽网”的机器人比那些拥有“窄网”的机器人更能匹配人类的分数。在第二项测试中,他们向人类和机器人展示了完全相同的产品描述,但对于其中一些描述,他们增加了一句关于该产品品牌或市场成功情况的话。当看到这些额外的语境时,人类的评分上升了;他们认为由于这些背景,产品变得更有创造力了。而机器人呢?它们的评分几乎没有变化。它们对那些能左右人类判断的社会线索完全视而不见。
那么,这意味着什么呢?这表明我们不能简单地将所有的 AI 评委视为同类。如果你想知道一个想法是否真正原创且新鲜,机器人可能是一个很好的帮手。但如果你需要知道一个想法是否能在现实世界中取得成功、是否符合品牌定位、或是否能引发人们的讨论,机器人可能会完全错过重点。这篇论文指出,选择合适的 AI 评委至关重要:不同的模型应用着不同的规则,因此它们会选出不同的优胜者。我们需要谨慎,不要假设机器人看到了全貌,因为它们往往是通过一个非常特定且狭窄的镜头在观察。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。