Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
本文介绍了一个可扩展且领域无关的框架,该框架通过结合用于衡量发散性新颖性的语义熵与用于评估收敛性任务完成度的基于检索的多智能体评审,来量化大语言模型在开放式任务中的创造力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图评判一群新进 AI 作家、发明家和问题解决者是否具有“创造力”的天才星探。在过去,评判创造力就像是用尺子去测量一幅画:过程混乱,需要人类专家对每一件作品进行评估,且仅适用于特定类型的艺术。
这篇论文介绍了一种全新的、自动化的“创造力计分卡”,它可以适用于任何类型的开放式任务,无论是解谜还是写故事。作者将创造力分解为两种截然不同的“超能力”,并分别对它们进行衡量:发散性思维(Divergent Thinking,即构思出许多不同想法的能力)和聚合性思维(Convergent Thinking,即挑选出最佳想法并使其生效的能力)。
以下是他们的系统运作方式,使用了简单的类比:
1. 衡量“做梦”(发散性创造力)
问题: 如何知道一个 AI 只是在用不同的措辞重复同一个想法,还是真的在探索新的领域?
旧方法: 统计词数或检查句子在表面上是否不同。这就像是通过一个厨师使用了多少种不同的词来描述“汤”来评判他,即便这些词描述的都是同一种味道。
新方法(语义熵): 作者使用了**语义熵(Semantic Entropy)**的概念。
- 类比: 假设你问一个 AI:“如何过河?”
- 低创造力的 AI 可能会说:“造一座桥”、“建一座桥”、“搭建一座桥”。这些看起来不同,但意思完全一样。其“熵”(多样性)很低。
- 高创造力的 AI 可能会说:“造一座桥”、“操控无人机飞过去”、“把藤蔓绑在一起”、“等待水面结冰”。这些是真正不同的路径。其“熵”很高。
- 结果: 这种方法充当了一个“多样性测量仪”。它忽略了表面的文字变化,转而衡量 AI 探索了多少个不同的概念方向。研究发现,这种测量方式比以往的方法更能匹配人类心目中认为的“创造力”。
2. 衡量“做事”(聚合性创造力)
问题: 产生天马行空的念头很容易;但确保这些想法能真正解决问题却很难。AI 可能会建议通过“飞龙”来过河,这虽然有创意,但毫无用处。
旧方法: 使用单个 AI 评审员或人类来阅读答案。这既缓慢、昂贵,又难以规模化。
新方法(基于检索的多智能体团队): 作者构建了一个由专门的 AI “评审员”组成的团队,他们协同工作,但加入了一个巧妙的设计以节省成本和时间。
- 类比: 想象一个专家小组(包括一名安全官、一名可行性专家和一名故事评论家)正在评审一个项目。
- 旧方法: 每次他们发言时,都要从头开始阅读整个对话历史。这就像是在开会时,每个人在说话前都要重新读一遍前 100 页的笔记。这会让内容变得臃漫且昂贵。
- 新方法: 团队使用了一个“智能档案系统”。他们不再重读所有内容,而是只调取与当前讨论点相关的特定笔记。
- 结果: 这种“基于检索”的方法在保持与人类专家同样准确度的同时,将计算成本降低了 63%。它确保了 AI 不仅仅是在胡言乱语,而是真正完成了任务要求。
3. 重大发现:两种不同的技能
该论文最令人惊讶的发现是,这两种技能——“做梦”与“做事”——并不会自动同步增长。
- 类比: 想想看一辆汽车。你可以拥有一台非常强大的引擎(聚合性/任务达成能力),它能完美地把你送到目的地,但这并不意味着驾驶员擅长在越野路段进行探索(发散性/创造力)。
- 发现: 随着 AI 模型在遵循指令方面变得越来越大、越来越聪明(聚合性),它们并不一定会变得更擅长探索疯狂的新想法(发散性)。事实上,那些规模最大、最“正确”的模型,其探索性有时反而比小型模型更低。论文指出,目前的训练让 AI 变得更擅长于“正确”,但未必会让它们变得更有“创造力”。
4. 测试系统
作者在三个完全不同的“游乐场”中测试了这个框架:
- MacGyver(马盖先): 利用日常物品解决物理问题(例如:“如何用一只袜子修补漏水处?”)。
- HypoGen: 提出新的科学研究构想。
- BookMIA: 在特定的起点和终点之间创作创意故事。
在所有这三个案例中,他们的系统都成功测量了 AI 的想法有多“广”,以及最终解决方案有多“好”,证明了该系统可以跨越不同类型的创造力进行有效测量。
总结
这篇论文提供了一个通用的、自动化的创造力标尺。它将生成许多独特想法的能力与正确解决问题的能力分离开来。它表明,虽然 AI 在解决问题方面变得越来越强,但它并不一定会自动变得更有想象力,因此我们需要新的工具来衡量并鼓励那种特定的“创造力火花”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。