← 最新论文
💻 computer science

AGC-Bench: Measuring Artificial General Creativity

本文介绍了 AGC-Bench,这是一个全面的基准测试与评估框架,它建立了一个统一的人工通用创造力衡量标准,揭示了与通用智能相区别的单一创造力因子,同时证明了顶尖人类创作者仍然优于当前的尖端大语言模型。

原作者: Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的测试库,旨在衡量不同人的“创造力”:有些测试让你想出砖块的新用途,有些让你写一个有趣的笑话,还有些让你解决科学难题。长期以来,研究人员一直在争论:创造力是一种能让你在所有这些领域都表现出色的“超级力量”(就像擅长数学可能有助于学习物理一样),还是由一系列独立的技能组成的(比如你可能是一位伟大的诗人,但在工程学方面却一窍不通)?

现在,我们有了能够写故事、解决问题和讲笑话的人工智能(AI)模型。但我们之前一直缺乏一种方法来衡量 AI 的创造力是一种通用的超级力量,还是仅仅是一套孤立的技巧。

这篇论文介绍了一个名为 AGC-Bench 的全新、庞大的“人工智能创造力健身房”。以下是他们所做的工作和发现,通过简单的解释呈现如下:

1. 构建终极创造力健身房

研究人员不仅仅是制作了一个新测试。相反,他们扮演了图书管理员和侦探的角色。他们扫描了超过 3,000 篇科学论文,以寻找 AI 领域出现过的每一个创造力测试。从这如山般的论文中,他们挑选了 78 个不同的测试(例如“头脑风暴”测试、“故事讲述”测试和“幽默”测试),并构建了一个统一的系统来同时运行它们。

这就像是建造了一个单一的健身房,里面有跑步机、举重架、攀岩墙和游泳池,并且所有的器材都经过校准,用以测量同一名运动员。他们在这座健身房里测试了 83 个不同的 AI 模型

2. “裁判”问题与新裁判员

当你要求一个 AI 给另一个 AI 的笑话或故事打分时,AI 裁判可能会产生偏差——有时过于严苛,有时又过于宽松。这就像有一个偏袒某队或讨厌某队的裁判。

为了解决这个问题,研究人员使用了一种被称为**裁判响应理论(Judge Response Theory)**的巧妙技巧。他们让三个不同的“超级 AI”裁判对每一个答案进行评分。然后,他们利用数学方法来确定哪个裁判是“严厉的教练”,哪个是“宽容的教练”。他们调整了分数,使得每个人都能得到公平的评判。最后,他们训练了一个新的开源 AI(称为 AGC-Judge)来充当一个完美的裁判,它能模拟这个公正的专家小组,以便以后任何人都可以直接使用,而无需依赖三个昂贵的超级 AI。

3. 重大发现:创造力是一体还是多元?

这是本文的核心问题。他们问道:如果一个 AI 擅长写故事,它是否会自动擅长解决科学问题?

答案是: 基本是的。
通过分析得分,他们发现 AI 的创造力表现得像是一个单一且强大的引擎。他们称之为 “C 因子”(类似于人类的一般智力“g 因子”)。

  • 比喻: 想象创造力是一把手电筒。如果一个 AI 拥有一把明亮的手电筒(高“C”值),它就能在所有不同的测试中都发出亮光,无论是写诗还是开玩笑。
  • 数据: 这单一的“C 因子”解释了模型之间 81.5% 的差异。如果你知道一个 AI 在某项创意任务上的表现,你几乎就能预测它在几乎任何其他创意任务上的表现。

然而,就像人类可能更擅长写作而非数学一样,顶尖的 AI 模型仍然存在细微的偏好。有些模型在幽默方面稍强,而另一些在科学构思方面稍强,但整体的“创意引擎”是相同的。

4. AI 的创造力只是“推理”的伪装吗?

有些人认为:“也许 AI 并不是在进行创作;它只是非常擅长逻辑和事实。”
研究人员通过要求模型“展现创造力”与“运用逻辑”来进行测试。

  • 结果: 告诉 AI “要具有创造力”对得分的提升,远比告诉它“使用你的推理大脑”要大。这证明了该测试实际测量的是创造力,而非仅仅是逻辑。

5. 人类 vs. AI:谁更具灵活性?

他们将 AI 的结果与参加相同测试的一组真实人类进行了对比。

  • 发现: 人类的创造力是非常“专业化”的。一个擅长写诗的人可能并不擅长解决工程难题。人类的创造力是分属于不同的“桶”中的。
  • AI 的差异: AI 表现得非常“通用”。一个擅长一件事的 AI 通常也擅长所有事。它不像人类那样具有专业分化。
  • 胜者: 尽管 AI 更有灵活性,但面对最难的任务时,最优秀的人类依然击败了最优秀的 AI。顶尖的人类比顶尖的 AI 稍微领先一点,但 AI 正在迅速追赶。

总结

这篇论文构建了一个巨大、公平且标准化的游乐场,用于衡量 AI 的创造力。他们发现,AI 的创造力是一个单一的、通用的能力(就像一个超级电池),它为各种类型的创意任务提供动力,而不是一系列零散的技能。虽然最优秀的 AI 已经非常接近最优秀的人类,但顶尖的人类仍然保持着领先地位,且人类的创造力比 AI 那种“全才型”的方法更具专业分化。

他们已经向公众发布了所有的工具、数据和那个“公平的裁判”AI,以便他人可以持续测试并改进这些模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →