✨ 要点🔬 技术摘要
核心理念:为什么“好”这件事很复杂
想象一下你正在评判一场烹饪比赛。
“客观”评委: 这位评委检查食物是否真的煮熟了、盐放了没有、盘子有没有碎。所有人对此都有共识。如果牛排是生的,那就是失败。
“主观”评委: 这位评委会问:“我喜欢这个味道吗?”一个人可能热爱辛辣,而另一个人可能讨厌辛辣。两者都没有错,只是口味不同。
问题所在: 当今大多数 AI 测试都像只有那位“客观”评委。它们试图强迫所有人对一个单一的分数达成一致(例如:“这个 AI 是 8/10 分”)。这篇论文的作者指出,在创意工作(如制作广告、网站或视频)中,这种方法是失效的。它丢弃了数据中最重要的一部分:即人们在审美上理应 存在分歧。
解决方案:创意的“马提尼酒杯”
作者提出了一种新的测试 AI 的方法,称为人类创意基准(Human Creativity Benchmark, HCB) 。他们将创意过程可视化为一个侧放的马提尼酒杯 (见论文中的图 1):
宽阔的部分(构思阶段/Ideation): 在开始时,你需要大量天马行空、各异的想法。这是“发散”(不同意见)表现良好的地方。
收窄的部分(原型制作阶段/Mockup): 你开始挑选最好的想法并使其看起来真实。
杯柄的部分(精修阶段/Refinement): 在最后,你在打磨最终产品。在这里,你需要针对技术细节(如拼写、布局以及产品是否真的可用)达成“收敛”(所有人达成一致)。
他们是如何测试的
他们并没有问“这个 AI 好不好?”,而是要求专业创意人士(设计师、视频编辑、程序员)从三个特定维度评估 AI 的输出:
指令遵循度(Prompt Adherence): AI 是否完全按照指令执行了任务?(就像遵循食谱一样)。
可用性(Usability): 这真的能在实际工作中被使用吗?(文字是否可读?按钮是否可以点击?)。
视觉吸引力(Visual Appeal): 它好看吗?(这是审美发挥作用的地方)。
他们在五个不同领域进行了这项测试,共收集了来自专家的 15,000 次判断 :落地页、桌面应用、广告图像、品牌图像和产品视频。
他们的发现(“顿悟”时刻)
1. “一致性”与“分歧”是不同的信号
收敛(一致性): 当 AI 犯错时(比如文字无法阅读或布局破碎),所有专家都会一致认为它很糟糕。当 AI 完美遵循规则时,他们也会一致认为它很好。
发散(分歧): 当 AI 在技术上是正确的时候,专家们会开始基于个人品味产生分歧。一位专家可能会说:“这个广告看起来像奢侈时尚风,”而另一位则说:“这看起来很廉价。”论文认为,这种分歧并不是错误,而是一种特性。 这意味着 AI 正在提供不同的创意方向。
2. 没有哪个 AI 能包揽一切 如果你只看平均分,你可能会认为某个 AI 是“最强”的。但论文发现,没有任何一个模型能在所有方面都表现最好。
有些模型擅长构思阶段 (提出天马行空的创意概念)。
有些模型则更擅长精修阶段 (修正错别字并让外观看起来专业)。
类比: 这就像说一辆一级方程式赛车比一辆皮卡车“更好”。F1 赛车在赛道上(精修阶段)获胜,但皮卡车在建筑工地(构思/实用阶段)更胜一筹。你需要针对工作的特定阶段选择合适的工具。
3. “单一评分”陷阱 论文警告说,如果你将所有这些不同的意见压缩成一个单一的数字(例如:“模型 X 是 4.2 星”),你会丢失最有价值的信息。你将无法看到模型在何处是可靠的(技术正确性),以及在何处是灵活的(创意风格)。
对人类与 AI 的启示
作者建议,我们不应该试图让 AI 达成关于“美”的单一定义。相反,我们应该:
当我们需要技术上的准确性时,使用**可靠(reliable)**的 AI 模型(追求收敛)。
当我们需要创意多样性时,使用**可控(steerable)**的 AI 模型(追求发散)。
简而言之:不要要求 AI 完美无缺,要要求它在正确的环节做到完美。 这个基准测试能帮助我们搞清楚,哪一个 AI 才是烹饪过程中特定菜肴的最佳“厨师”。
技术摘要:人类创造力基准 (The Human Creativity Benchmark)
问题陈述
当前的 AI 创意领域评估框架将评估者之间的分歧视为需要解决的噪声,通常将多样化的专业判断压缩为单一的“地面真值”(ground truth)或综合质量得分。作者认为,这种方法在创意工作中存在根本性缺陷。在专业的创意语境下,分歧往往反映了在审美方向和创意意图上的真实差异,而非测量误差。通过强制趋同,现有的基准测试掩盖了专业人士在“对共享最佳实践达成一致(趋同)”与“个体偏好合法存在差异(分歧)”这两个维度上的区别。这种还原论风险在于,它可能导致生成的 AI 输出趋于同质化,从而无法支持创意实践的多样性,也无法满足创意人员在不同工作流阶段的特定需求。
方法论
本文引入了人类创造力基准 (HCB) ,这是一个旨在将创意评估中的趋同与分歧进行操作化分离的数据集和框架。
数据收集与结构
参与者: 来自 Contra(一个独立专业创意人网络)的 28 位领域专家,分布在 13 个国家。
领域: 评估了五个创意领域:落地页 (Landing Pages)、桌面应用程序 (Desktop Applications)、广告图像 (Ad Images)、品牌图像 (Brand Images) 和产品视频 (Product Videos)。
工作流阶段: 该基准模拟了现实世界中跨越三个阶段的创意工作流:
构思阶段 (Ideation): 探索创意方向的发现与探索。
原型阶段 (Mockup): 将选定的方向转化为连贯的规格说明。
精修阶段 (Refinement): 针对生产就绪度和一致性进行针对性的微调。
模型: 评估了 13 个前沿生成式模型,包括图像生成模型(如 GPT-Image-1.5, Flux-2-Pro)、视频生成模型(如 Veo3.1, Kling-v3.0)和代码生成模型(如 Claude-Opus-4.6, GPT-5.3-Codex)。
评估指标: 每个模型输出通过三种互补的信号进行评估:
成对偏好 (Pairwise Preferences): 对模型输出进行强制排序,并通过 Bradley-Terry 模型进行聚合,以产生 ELO 评分。
标量评分 (Scalar Ratings): 在三个特定轴线上进行李克特量表(1–5 分)评分:
提示词遵循度 (Prompt Adherence): 对提示词的忠实度(主观性最低)。
可用性 (Usability): 在专业语境下的功能可行性。
视觉吸引力 (Visual Appeal): 美学趣味与精致度(主观性最高)。
定性理由 (Qualitative Rationales): 用于解释选择的开放式说明,通过主题编码进行分析。
分析方法
研究采用统计度量(用于分析一致性的 Kendall's W、用于可靠性的 Krippendorff's α \alpha α 以及用于显著性检验的 Friedman 检验)来分析评估者一致性如何随阶段和维度而变化。分析专门测试了模型是否在“趋同-分歧”光谱上表现一致,以及当按阶段而非作为单一聚合体进行评估时,模型排名是否会发生变化。
核心贡献
人类创造力基准 (HCB): 一个公开数据集,包含 15,000 条专业判断,涵盖了提示词-图像对、成对排序、标量评分以及跨五个领域和三个工作流阶段的定性理由。
趋同-分歧框架: 一个理论与操作性的区分,将创意评估分为:
趋同 (Convergence): 评估者在可验证标准(如技术正确性、视觉层级)上达成一致的维度。
分歧 (Divergence): 基于个体品味而存在多种有效判断的维度(如审美方向、概念风险)。
创意工作流的实证分析: 证明了创意需求并非静态;它们在从构思到精修的过程中会发生显著变化,并且没有任何单一模型能在所有阶段或领域中表现出统一的卓越。
结果
标准与品味的分离: 评估轴并非互换的。评估者在提示词遵循度 (可验证的标准)上的共识最高,而在视觉吸引力 (由品味驱动)上的共识最低。可用性 处于中间位置。例如,在广告图像领域,对提示词遵循度的共识保持在高位,而视觉吸引力的得分则因个人偏好而差异巨大。
阶段依赖型需求: “好”输出的标准随着工作流的推进而变化。
在构思阶段 ,评估者优先考虑生成潜力和结构方向。
在原型阶段 ,重点转向提示词遵循度、网格结构和色彩一致性。
在精修阶段 ,随着标准收窄至排版和特定编辑等生产就绪元素,一致性达到顶峰。
没有普适的领导者: 没有单个模型在任何领域的三个阶段中都处于领先地位。例如,在桌面应用领域,Claude 4.6 在构思和原型阶段领先,而 GPT 5.3 在精修阶段领先。在产品视频领域,Veo 3.1 在构思阶段领先,但 Grok Imagine 在精修阶段领先。
聚合中的信号损失: 将这些不同的信号压缩为单一质量指标会丢弃有价值的信息。一个模型可能在趋同轴(提示词忠实度)上非常可靠,但在分歧轴(审美多样性)上表现较差,反之亦然。
意义与主张
论文声称,评估创意 AI 需要保留趋同与分歧的信号。其观点如下:
分歧是信号,而非噪声: 创意领域中的专业分歧通常是特征而非缺陷,反映了品味固有的主观性。
上下文优化: 模型开发者应优化在趋同轴上的可靠性(确保技术正确性),同时保持在分歧轴上的可控性(允许创意变化)。
工作流对齐: 应根据创意过程的具体阶段来选择工具。适用于构思的模型可能并不适用于精修,反之亦然。
防止同质化: 通过承认分歧,该领域可以避免“模式坍缩”(mode collapse),即 AI 系统向平均值收敛,从而保留创意声音和风格的多样性。
作者总结道,创意 AI 评估的未来在于超越单维度的排名,转向能够识别创意工作混合本质(平衡客观标准与主观偏好)并支持创意人员在整个工作流中动态需求的框架。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。