← 最新论文
📊 statistics

TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design

本文介绍了由专业设计师依据九项平面设计标准标注的多维偏好数据集 TASTE,并证明尽管当前的 AI 评估器难以与人类共识相匹配,但基于该数据集训练的专业模型能显著提升与专家判断的一致性。

原作者: Haonan Zhu, Elad Hirsch, Alexandria Minetti, Allison Nulty, Purvanshi Mehta

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Haonan Zhu, Elad Hirsch, Alexandria Minetti, Allison Nulty, Purvanshi Mehta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位老板,正在招聘一名平面设计师。你有两位候选人,于是你让团队中的五位资深设计师来挑选出更优秀的一位。

在人工智能(AI)领域,我们一直通过一个非常简单的规则来训练计算机生成图像:“哪张照片看起来更真实?”或者“哪张图片更漂亮?”这种方法在生成猫咪或日落的照片时效果极佳。然而,当涉及到平面设计(如海报、广告或应用界面布局)时,“漂亮”远远不够。一张海报可能看起来很美,但字体错误、文字拼写有误,或者颜色与品牌风格冲突。

本文介绍了TASTE,这是一种新工具,旨在教导 AI 如何成为一名真正的平面设计师,而不仅仅是一个漂亮图片的生成器。

以下是他们所做工作的分解,并辅以一些日常类比:

1. 问题所在:“一刀切”的评判者

想象你正在评判一场烹饪比赛。

  • 旧版 AI 评判者:它们只问:“这道菜看起来好吃吗?”如果食物看起来不错,它们就会给出高分,即使它太咸或温度不对。
  • 现实情况:真正的厨师(人类设计师)会从多个维度评判食物:调味是否得当?摆盘是否整洁?厨师是否遵循了食谱?是否使用了正确的食材?

作者发现,当前的 AI 模型是在“看起来美味的食物”(照片风格数据)上进行训练的,但它们需要的是在“遵循食谱且味道正确”的食物(平面设计数据)上进行训练。单一的“点赞”标签是不够的,因为它掩盖了设计失败的原因。

2. 解决方案:"TASTE"数据集

团队创建了一个名为TASTE(排版、美学、空间、基调等)的数据集。你可以将其想象成一份详尽的成绩单。

  • 参与者:他们聘请了 10 名专业的人类设计师。
  • 比赛:他们要求四种不同的人工智能图像生成器根据特定的提示(例如“为一家咖啡店制作传单”)来创作设计。
  • 评分:设计师们不再只是说“我喜欢这个”,而是根据九个具体类别对 AI 进行评分:
    • 排版:字体选择和间距是否得当?
    • 视觉层级:能否看出什么是最重要的视觉焦点?
    • 色彩和谐:颜色搭配是否协调?
    • 空间准确性:布局是否位于应有的位置?
    • 幻觉:AI 是否凭空捏造了未要求的内容(例如在咖啡店广告中出现了一只狗)?

他们在每个类别上进行了 1,600 次不同的评分。这清晰地描绘了人类设计师真正关心的内容。

3. “真相测试”:人类设计师的意见是否一致?

在利用这些数据训练 AI 之前,他们必须确保人类设计师不是在随机猜测。他们使用了三种统计“测谎”测试:

  1. 他们是否对排名达成一致?(就像问 5 个人对他们最喜欢的冰淇淋口味进行排名)。
  2. 是否有明确的赢家?(大多数人是否同意首选,还是完全平局?)。
  3. 是否存在逻辑循环?(如果 A 认为 X 优于 Y,且 Y 优于 Z,那么 A 是否也认为 X 优于 Z?或者他们感到困惑?)。

结果:人类设计师之间的一致性远高于随机猜测者,但低于人们对“这张照片是否模糊”达成一致的程度。这表明平面设计是客观规则(如拼写)和主观品味(如色彩氛围)的混合体。它处于“遵循食谱”与“成为艺术家”之间的“甜蜜点”。

4. 现实检验:当前的 AI 评判者能做到这一点吗?

作者测试了当今最智能的 AI 评判者(即“裁判”),看它们能否预测人类设计师的选择。

  • 得分:表现最好的 AI 评判者准确率约为54%
  • 类比:这就像抛硬币。如果你抛硬币来猜测人类设计师会选谁,你有 50% 的机会猜对。AI 评判者仅仅比抛硬币好一点点。
  • 问题:更大的 AI 模型并没有显著提高表现。似乎当前的 AI 评判者擅长识别“漂亮的照片”,却不擅长识别“好的设计”。它们会被文字、布局和具体指令搞糊涂。

5. 新的“教练”:一个小型、专用的模型

由于大型通用 AI 评判者未能成功,作者构建了一个小型、专用的“教练”(一个小型 AI 模型),专门在 TASTE 数据上进行训练。

  • 技巧:这个教练不再一次只看一张图片,而是并排查看两张图片,并问:“这两张图片之间的差异是什么,使得其中一张更好?”
  • 结果:这位新教练的准确率达到61%
  • 上限:作者计算出,即使是完美的 AI,准确率也只能达到约74%,因为有时人类之间也会意见不一。因此,这位新教练已经填补了“随机猜测”与“人类专家”之间大约一半的差距。

总结

本文指出:“我们不能仅仅教导 AI 制作漂亮的图片。我们需要利用名为 TASTE 的新数据集,教导它掌握设计的具体规则(字体、布局、颜色)。当前的 AI 评判者在此方面表现不佳,但一个基于我们新数据训练的小型专用模型正开始入门。我们现在正在将此数据提供给世界,以便其他人能够构建更好的设计工具。”

本文并未声称

  • 它不声称 AI 现在可以取代人类设计师。
  • 它不声称这解决了所有设计问题(例如可访问性或品牌一致性,它们承认这些方面尚缺失)。
  • 它不声称更大的模型会自动解决问题;事实上,他们发现仅仅增大模型规模并没有太大帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →