AGC-Bench: Measuring Artificial General Creativity
本文介绍了 AGC-Bench,这是一个全面的基准测试与评估框架,它建立了一个统一的人工通用创造力衡量标准,揭示了与通用智能相区别的单一创造力因子,同时证明了顶尖人类创作者仍然优于当前的尖端大语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的测试库,旨在衡量不同人的“创造力”:有些测试让你想出砖块的新用途,有些让你写一个有趣的笑话,还有些让你解决科学难题。长期以来,研究人员一直在争论:创造力是一种能让你在所有这些领域都表现出色的“超级力量”(就像擅长数学可能有助于学习物理一样),还是由一系列独立的技能组成的(比如你可能是一位伟大的诗人,但在工程学方面却一窍不通)?
现在,我们有了能够写故事、解决问题和讲笑话的人工智能(AI)模型。但我们之前一直缺乏一种方法来衡量 AI 的创造力是一种通用的超级力量,还是仅仅是一套孤立的技巧。
这篇论文介绍了一个名为 AGC-Bench 的全新、庞大的“人工智能创造力健身房”。以下是他们所做的工作和发现,通过简单的解释呈现如下:
1. 构建终极创造力健身房
研究人员不仅仅是制作了一个新测试。相反,他们扮演了图书管理员和侦探的角色。他们扫描了超过 3,000 篇科学论文,以寻找 AI 领域出现过的每一个创造力测试。从这如山般的论文中,他们挑选了 78 个不同的测试(例如“头脑风暴”测试、“故事讲述”测试和“幽默”测试),并构建了一个统一的系统来同时运行它们。
这就像是建造了一个单一的健身房,里面有跑步机、举重架、攀岩墙和游泳池,并且所有的器材都经过校准,用以测量同一名运动员。他们在这座健身房里测试了 83 个不同的 AI 模型。
2. “裁判”问题与新裁判员
当你要求一个 AI 给另一个 AI 的笑话或故事打分时,AI 裁判可能会产生偏差——有时过于严苛,有时又过于宽松。这就像有一个偏袒某队或讨厌某队的裁判。
为了解决这个问题,研究人员使用了一种被称为**裁判响应理论(Judge Response Theory)**的巧妙技巧。他们让三个不同的“超级 AI”裁判对每一个答案进行评分。然后,他们利用数学方法来确定哪个裁判是“严厉的教练”,哪个是“宽容的教练”。他们调整了分数,使得每个人都能得到公平的评判。最后,他们训练了一个新的开源 AI(称为 AGC-Judge)来充当一个完美的裁判,它能模拟这个公正的专家小组,以便以后任何人都可以直接使用,而无需依赖三个昂贵的超级 AI。
3. 重大发现:创造力是一体还是多元?
这是本文的核心问题。他们问道:如果一个 AI 擅长写故事,它是否会自动擅长解决科学问题?
答案是: 基本是的。
通过分析得分,他们发现 AI 的创造力表现得像是一个单一且强大的引擎。他们称之为 “C 因子”(类似于人类的一般智力“g 因子”)。
- 比喻: 想象创造力是一把手电筒。如果一个 AI 拥有一把明亮的手电筒(高“C”值),它就能在所有不同的测试中都发出亮光,无论是写诗还是开玩笑。
- 数据: 这单一的“C 因子”解释了模型之间 81.5% 的差异。如果你知道一个 AI 在某项创意任务上的表现,你几乎就能预测它在几乎任何其他创意任务上的表现。
然而,就像人类可能更擅长写作而非数学一样,顶尖的 AI 模型仍然存在细微的偏好。有些模型在幽默方面稍强,而另一些在科学构思方面稍强,但整体的“创意引擎”是相同的。
4. AI 的创造力只是“推理”的伪装吗?
有些人认为:“也许 AI 并不是在进行创作;它只是非常擅长逻辑和事实。”
研究人员通过要求模型“展现创造力”与“运用逻辑”来进行测试。
- 结果: 告诉 AI “要具有创造力”对得分的提升,远比告诉它“使用你的推理大脑”要大。这证明了该测试实际测量的是创造力,而非仅仅是逻辑。
5. 人类 vs. AI:谁更具灵活性?
他们将 AI 的结果与参加相同测试的一组真实人类进行了对比。
- 发现: 人类的创造力是非常“专业化”的。一个擅长写诗的人可能并不擅长解决工程难题。人类的创造力是分属于不同的“桶”中的。
- AI 的差异: AI 表现得非常“通用”。一个擅长一件事的 AI 通常也擅长所有事。它不像人类那样具有专业分化。
- 胜者: 尽管 AI 更有灵活性,但面对最难的任务时,最优秀的人类依然击败了最优秀的 AI。顶尖的人类比顶尖的 AI 稍微领先一点,但 AI 正在迅速追赶。
总结
这篇论文构建了一个巨大、公平且标准化的游乐场,用于衡量 AI 的创造力。他们发现,AI 的创造力是一个单一的、通用的能力(就像一个超级电池),它为各种类型的创意任务提供动力,而不是一系列零散的技能。虽然最优秀的 AI 已经非常接近最优秀的人类,但顶尖的人类仍然保持着领先地位,且人类的创造力比 AI 那种“全才型”的方法更具专业分化。
他们已经向公众发布了所有的工具、数据和那个“公平的裁判”AI,以便他人可以持续测试并改进这些模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。