← 最新论文
💻 computer science

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

本文介绍了 Qwen-Image-Bench,这是一个与专业艺术家共同设计的以创作者为中心的基准测试,它通过涵盖真实世界保真度和创意生成方面的 56 个可验证准则的分层分类法来评估文本生成图像模型,并利用专门的评判模型提供细粒度的诊断,从而比现有基准测试更好地区分最先进的性能表现。

原作者: Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan
发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yuxiang Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, Hongzhu Shi, Yi Wang, Bing Zhao, Hu Wei, Lin Qu, Chenfei Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你一直在试图评判新一代的 AI 艺术家。长期以来,测试就像是一堂基础美术课:“你让 AI 画一只猫,它画出猫了吗?画面清晰吗?看起来好看吗?”

但现在,AI 艺术家们已经非常擅长画简单的猫了,这些旧的测试已经无法区分“优秀”的艺术家和“大师级”的艺术家了——它们都能拿到“A”,导致你无法看出谁才是真正的顶尖高手。此外,旧的测试并不关心这只猫是否符合现实世界的逻辑,也不关心 AI 是否真的能设计一个游戏角色。

这篇论文介绍了 Qwen-Image-Bench,这是一个全新的、极其严格的“艺术奥林匹克”,专门用于测试专业级的创造力,而非仅仅是基础绘画技能。

以下是他们如何构建它以及他们的发现,通过简单易懂的方式进行解释:

1. 新的规则手册:三层金字塔结构

研究人员没有使用简单的清单,而是构建了一个由职业艺术家(画家、导演、设计师)而非仅仅是计算机科学家设计的三层金字塔规则体系。

  • 第一层(核心支柱): 他们保留了旧有的基础指标(质量、美学、以及“是否听从指令”),但增加了两个对真实创作者至关重要的全新支柱:
    • 现实世界保真度(Real-world Fidelity): 物理规律是否合理?文化背景是否正确?(例如:如果你要求画一个中世纪骑士,盔甲是否符合历史真实性?)
    • 创意生成(Creative Generation): AI 是否真的能创造出新颖且有用的东西?(例如:设计一个 Logo、编写漫画剧本或创建一个游戏资产)。
  • 第二层(技能): 这些大支柱被细分为 23 项具体技能,如“视觉叙事”或“世界知识”。
  • 第三层(细节): 最后,他们将视角缩放到了 56 个微小的特定细节(评分标准)。这是“显微镜”级别。它会检查诸如“字体是否清晰可读?”或“手部与物体的接触是否正确?”等细节。

类比: 把旧的测试想象成问:“这个蛋糕能吃吗?”而新的测试则是在问:“这个蛋糕能吃吗?它尝起来像专业烘焙坊做出来的吗?装饰是否结构稳固?烘焙师是否遵循了特定的无麸质婚礼蛋糕配方?”

2. “超级裁判”(Q-Judger)

通常,为了给这些图像评分,人们要么雇佣人类(昂贵且缓慢),要么要求另一个 AI 来评分(这很冒险,因为评分的 AI 可能会有偏见或偷懒)。

团队创建了一个名为 Q-Judger统一评审模型

  • 运作方式: 他们利用超过 13 万张由 80 位真实人类专家(来自艺术院校)评分的图像对该 AI 进行了训练。
  • 流程: 每张图像都至少经过了三位不知道图像来源的专家的盲测。
  • 结果: Q-Judger 不仅仅给出一个像“8/10”这样的单一分数。它会针对所有 56 个微小细节提供一份详细的成绩单。它可以准确地告诉你 AI 在哪里失败了:“擅长画天空,但在画手部时失败了。”

3. 测试:1,000 个真实世界的提示词

他们不仅仅是要求“一只猫”。他们创建了 1,000 个复杂的提示词,涵盖中英文。

  • 有些提示词很短,有些则非常长且细节丰富。
  • 它们涵盖了现实生活中的场景:“设计一个辣肉食谱的日志页面”、“为电影场景创作分镜脚本”或“为特定角色设计一套时尚服装”。
  • 这确保了测试能够检验 AI 处理人类实际提出的复杂、混乱请求的能力。

4. 结果:谁赢了,谁在挣扎?

他们测试了全球 18 个顶尖 AI 模型。这场“艺术奥林匹克”揭示了以下内容:

  • 冠军: GPT Image 2 摘得了金牌,在各项指标中得分最高。它是唯一一个没有任何明显弱点的模型。

  • “天花板”问题: 最令人震惊的发现是,有 五项特定的任务,即使是冠军在内的所有模型得分都非常低(低于 44 分/满分 100 分)。

    • 这些任务分别是:物理逻辑(重力、物体如何落下)、解剖保真度(人体/动物体型结构)、动物物体(3D 结构)以及接触交互(物体如何相互接触)。
    • 隐喻: 目前的 AI 模型就像是从未见过真实世界的写实派画家。它们可以完美地模仿树木的外观,但并不理解树木是如何生长、枝干如何连接,或者鸟儿是如何落在上面的。它们仍处于“感知”阶段(模仿所见),尚未达到“认知”阶段(理解世界运作的方式)。
  • “创意”差距: 顶尖模型与普通模型之间的最大区别不在于基础绘画质量(现在大家都很擅长这一点),而在于创意生成现实世界保真度。顶尖模型能够真正进行设计并理解复杂的逻辑;而较低级别的模型只能做出一些漂亮但逻辑不通的图片。

总结

Qwen-Image-Bench 是一个衡量 AI 艺术的新型专业级标尺。它证明了虽然 AI 在制作“漂亮的图片”方面已经做得非常好,但在理解现实世界的逻辑以及作为真正的创意伙伴方面仍然面临挑战。论文得出结论:要达到下一个阶段,AI 需要停止仅仅模仿视觉模式,转而开始学习这个世界实际运作的“规则”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →