Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers
本文系统评估了现有用于预测大语言模型(LLM)在写作、发散性思维和科学构思方面表现的人类创造力测试,揭示了其效度的局限性,并提出了发散性远程联想测试(DRAT)作为首个能够同时评估聚合思维与发散性思维、从而预测科学构思能力的稳健工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个由非常聪明的机器人(大型语言模型,或称 LLM)组成的巨型图书馆。你想知道其中哪些真正具备“创造力”。但如何衡量机器的创造力呢?
长期以来,科学家们一直试图沿用那些用于人类的测试来给这些机器人评分。这就像因为想知道鱼爬树的能力有多强,就去测量它爬树一样。本文认为,虽然其中一些旧测试尚可适用,但它们往往无法讲述完整的故事,尤其是在涉及科学构想时。
以下是研究人员发现的内容以及他们为解决问题而构建的方案,简要说明如下:
1. 问题所在:使用了错误的标尺
研究人员考察了人类所接受的两种主要“创造力测试”:
- 发散思维:要求某人针对一个问题提出许多不同且奇特的答案(例如“列出 10 个彼此完全不同的事物”)。
- 聚合思维:要求某人找出一个能将三个互不相关的事物联系起来的正确答案(例如“小屋”、“瑞士”和“蛋糕” “奶酪”)。
该团队利用这些人类测试对数十种人工智能模型进行了测试。他们发现了一些令人惊讶的情况:
- “聪明”陷阱:许多看似衡量创造力的测试,实际上仅仅是在衡量机器人有多“聪明”或知识储备有多丰富。如果一个机器人在数学和阅读方面表现出色,它自然会在这些测试中获得高分,即使它并没有真正展现出创造力。这就像因为一名学生在数学考试中得了高分,就将其称为“创造力测试”一样。
- “科学”盲区:最令人震惊的发现是,没有任何现有的人类测试能够可靠地预测人工智能是否能提出优秀的科学构想。你可能拥有一个擅长写故事或列举随机单词的机器人,但它却完全无法发明新的科学理论。旧标尺根本无法胜任这项工作。
- 新模型的悖论:随着人工智能模型变得越来越新、越来越强大,它们在发散思维(提出独特、奇特想法)方面实际上表现得更差。它们变得更加僵化和标准化,就像工厂反复生产同一种饼干,而不是像厨师那样发明新食谱。
2. 解决方案:一种新的混合测试(DRAT)
由于旧测试在预测科学创造力方面失效,作者发明了一种名为**发散远程联想测试(DRAT)**的新测试。
可以将旧测试想象成两种独立的工具:
- 工具 A(发散):一把大锤,用来把东西砸碎,看看能产生多少不同的碎片。
- 工具 B(聚合):一把螺丝刀,用来把东西拧紧,以找到完美的契合点。
科学创造力的问题在于,你需要同时具备这两种能力。你需要把想法砸碎以寻找新事物,但随后又需要将它们拧紧,以确保它们实际上合乎逻辑并能解决问题。
DRAT 的工作原理:
想象你给人工智能三个截然不同的“锚点”词(例如“心跳”、“管道”和“拓扑”)。
- 挑战:人工智能必须生成 10 个彼此完全不同的单词(发散)。
- 限制:但是,这 10 个单词中的每一个都必须能够隐喻性地连接到所有三个锚点词(聚合)。
这就像要求一位诗人写出 10 首完全不同的诗,但每一首诗都必须秘密地关于某种特定的复杂机器。如果人工智能能做到这一点,就证明它能够同时进行狂野的思考和逻辑的推演。
3. 结果
当他们测试这个新的 DRAT 工具时:
- 它奏效了! 这是第一个能够成功预测哪些人工智能模型擅长提出科学构想的测试。
- 它不仅仅是部分的总和:研究人员尝试将旧的“砸碎”测试和旧的“拧紧”测试结合起来,看看是否有效。结果并不理想。新的 DRAT 工具做到了两件旧工具单独无法做到的特殊事情。它证明,要衡量科学创造力,必须同时测试狂野想象和逻辑关联的能力。
核心结论
该论文得出结论:我们不能仅仅沿用旧的人类测试来给人工智能的创造力评分。
- 如果你想知道人工智能是否擅长写故事,请使用“发散联想任务”(即那个奇怪的单词列表)。
- 如果你想知道人工智能是否擅长发散思维(列出多种选项),请使用“条件发散联想任务”。
- 但如果你想知道人工智能能否发明新的科学,你就需要新的DRAT测试,因为它能检测机器是否能同时具备狂野的想象力和逻辑关联性。
简而言之:要衡量机器人的科学天才,你需要一种测试,迫使它在走钢丝(聚合)的同时玩火(发散)。而旧测试只要求它做其中一项。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。