← 最新论文
💻 computer science

The Human Creativity Benchmark

该论文介绍了人类创造力基准(Human Creativity Benchmark, HCB),该基准区分了专业人士在技术正确性上的趋同性与在审美趣味上的差异性,旨在论证评估创意人工智能需要保留这些截然不同的信号,而非将它们合并为单一的质量指标。

原作者: Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:为什么“好”这件事很复杂

想象一下你正在评判一场烹饪比赛。

  • “客观”评委: 这位评委检查食物是否真的煮熟了、盐放了没有、盘子有没有碎。所有人对此都有共识。如果牛排是生的,那就是失败。
  • “主观”评委: 这位评委会问:“我喜欢这个味道吗?”一个人可能热爱辛辣,而另一个人可能讨厌辛辣。两者都没有错,只是口味不同。

问题所在: 当今大多数 AI 测试都像只有那位“客观”评委。它们试图强迫所有人对一个单一的分数达成一致(例如:“这个 AI 是 8/10 分”)。这篇论文的作者指出,在创意工作(如制作广告、网站或视频)中,这种方法是失效的。它丢弃了数据中最重要的一部分:即人们在审美上理应存在分歧。

解决方案:创意的“马提尼酒杯”

作者提出了一种新的测试 AI 的方法,称为人类创意基准(Human Creativity Benchmark, HCB)。他们将创意过程可视化为一个侧放的马提尼酒杯(见论文中的图 1):

  1. 宽阔的部分(构思阶段/Ideation): 在开始时,你需要大量天马行空、各异的想法。这是“发散”(不同意见)表现良好的地方。
  2. 收窄的部分(原型制作阶段/Mockup): 你开始挑选最好的想法并使其看起来真实。
  3. 杯柄的部分(精修阶段/Refinement): 在最后,你在打磨最终产品。在这里,你需要针对技术细节(如拼写、布局以及产品是否真的可用)达成“收敛”(所有人达成一致)。

他们是如何测试的

他们并没有问“这个 AI 好不好?”,而是要求专业创意人士(设计师、视频编辑、程序员)从三个特定维度评估 AI 的输出:

  1. 指令遵循度(Prompt Adherence): AI 是否完全按照指令执行了任务?(就像遵循食谱一样)。
  2. 可用性(Usability): 这真的能在实际工作中被使用吗?(文字是否可读?按钮是否可以点击?)。
  3. 视觉吸引力(Visual Appeal): 它好看吗?(这是审美发挥作用的地方)。

他们在五个不同领域进行了这项测试,共收集了来自专家的 15,000 次判断:落地页、桌面应用、广告图像、品牌图像和产品视频。

他们的发现(“顿悟”时刻)

1. “一致性”与“分歧”是不同的信号

  • 收敛(一致性): 当 AI 犯错时(比如文字无法阅读或布局破碎),所有专家都会一致认为它很糟糕。当 AI 完美遵循规则时,他们也会一致认为它很好。
  • 发散(分歧): 当 AI 在技术上是正确的时候,专家们会开始基于个人品味产生分歧。一位专家可能会说:“这个广告看起来像奢侈时尚风,”而另一位则说:“这看起来很廉价。”论文认为,这种分歧并不是错误,而是一种特性。 这意味着 AI 正在提供不同的创意方向。

2. 没有哪个 AI 能包揽一切
如果你只看平均分,你可能会认为某个 AI 是“最强”的。但论文发现,没有任何一个模型能在所有方面都表现最好。

  • 有些模型擅长构思阶段(提出天马行空的创意概念)。
  • 有些模型则更擅长精修阶段(修正错别字并让外观看起来专业)。
  • 类比: 这就像说一辆一级方程式赛车比一辆皮卡车“更好”。F1 赛车在赛道上(精修阶段)获胜,但皮卡车在建筑工地(构思/实用阶段)更胜一筹。你需要针对工作的特定阶段选择合适的工具。

3. “单一评分”陷阱
论文警告说,如果你将所有这些不同的意见压缩成一个单一的数字(例如:“模型 X 是 4.2 星”),你会丢失最有价值的信息。你将无法看到模型在何处是可靠的(技术正确性),以及在何处是灵活的(创意风格)。

对人类与 AI 的启示

作者建议,我们不应该试图让 AI 达成关于“美”的单一定义。相反,我们应该:

  • 当我们需要技术上的准确性时,使用**可靠(reliable)**的 AI 模型(追求收敛)。
  • 当我们需要创意多样性时,使用**可控(steerable)**的 AI 模型(追求发散)。

简而言之:不要要求 AI 完美无缺,要要求它在正确的环节做到完美。 这个基准测试能帮助我们搞清楚,哪一个 AI 才是烹饪过程中特定菜肴的最佳“厨师”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →