Using Large Language Models for Idea Generation in Innovation
这项研究表明,虽然与人类生成的创意相比,人工智能生成的产物在创新性和多样性方面表现较低,但它们在平均购买意愿方面显著优于人类创意,并且进入前10%高质量概念行列的可能性是人类创意的七倍。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正站在一片名为“创意景观”的广袤、多雾的田野中。你的目标是在这片田野的某个地方找到最珍贵的单一宝藏。在商业和创新的世界里,这份宝藏就是人们会爱不释手并愿意购买的绝妙新产品创意。长期以来,寻找这些宝藏的唯一方法是派出人类探险队。这些人类会在四周徘徊,一个接一个地挖掘创意。游戏的规则一直是:你不需要每一个创意都完美无缺;你只需要找到几颗绝对的瑰宝即可。如果你挖掘了100个创意,其中99个是石头,但有一个是钻石,你就赢了。但如果雇佣一个神奇、超快速的机器人,能在人类挖掘十个创意的同时挖掘出1000个创意,那会怎样?这正是科学家们正在探讨的问题。具体来说,他们正在测试“大语言模型”(LLMs)——这些是经过几乎整个互联网上所有文字训练的超级智能计算机程序。这些程序擅长写故事和回答问题,但它们在发明新事物方面能像人类一样具有创造力吗?本论文旨在研究这些“数字梦想家”是否真的能比真人更擅长发明创造。
来自顶尖大学的研究人员决定通过一个特定的挑战来测试这一点:为大学生发明一种成本在50美元或以下的实物产品。他们收集了三组不同的“创意生成器”。第一组是大学学生,他们在人工智能工具(如ChatGPT)广泛普及之前就修读过产品设计课程。第二组是一个计算机程序(GPT-4),它在面对简单的指令(类似于一张白纸,这被称为“零样本”提示)时生成创意。第三组是同一个计算机程序,但这一次,它先看到了几个优秀的案例,以帮助它进入状态(这被称为“少样本”提示)。
为了衡量谁做得最好,研究人员并没有仅仅询问专家,而是询问了普通人。他们向一大群大学生展示了数百个这些产品创意,并问道:“你有多大可能购买这个产品?”他们将这些回答转化为一个“购买得分”来衡量质量。他们还使用了计算机工具来检查创意之间的相似程度,并让人们对这些创意感觉多么“新颖”或“独特”进行评分。
以下是他们的发现,这非常令人惊讶。首先,AI在核心任务上表现得更好:即创造人们想要购买的创意。平均而言,计算机生成的创意得分高于学生制作的创意。那个在开始时获得了几个示例的计算机(少样本提示)表现最为出色。这就像机器人对客户的需求有着更好的“听觉”。
然而,这里有一个陷阱。虽然AI更擅长制造“好”的创意,但它并不擅长制造“不同”的创意。计算机生成的创意往往看起来和听起来非常相似。如果你把人类学生想象成在整个多雾的田野中探索,那么AI似乎总是停留在特定的一两个点上,挖掘着许多相同宝藏的变体。人们评价计算机的创意也觉得其“新颖性”或“独特性”略低。这就像是机器人非常擅长打磨现有的概念,但在像人类那样跳出框架思考方面遇到了困难。
但这里是最令人兴奋的部分。在创新领域,平均水平的创意并不重要,重要的是“最好的”那个创意。研究人员查看了所有收集到的创意中排名前10%的部分——即那些绝对顶尖的创意。他们发现,与人类相比,AI产生进入这前10%梯队的创意的概率要高出七倍。每当学生想出一个伟大的创意时,计算机就会产生七个。
作者认为,这实际上是一个保守的估计。他们甚至没有计算计算机的速度有多快。人类可能需要15分钟才能想出五个创意,而计算机在同样的时间内可以生成200个创意。因此,计算机不仅在质量上更胜一筹,它还是一个“生产力怪兽”。
论文总结道,虽然AI可能不像人类的头脑风暴那样狂野或多样化,但它是寻找高质量、市场化创意的强大力量。这表明,在未来,公司可能不需要花费这么多时间从零开始构思创意。相反,他们可以让AI快速生成数百个高质量的选择,然后让人类专注于挑选最好的创意并将其做得更好。机器人并不是在取代人类的梦想家,它是在给人类提供一把超级强力的铲子,让人们能更快地挖掘出钻石。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。