← 最新论文
🤖 machine learning

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

本文提出了 ImagenWorld 基准,该基准包含 3600 个涵盖六大任务与领域的开放世界条件集及 2 万条细粒度人工标注,通过可解释的评估体系对 14 个图像生成模型进行了大规模压力测试,揭示了当前模型在编辑任务、文本密集型领域及细粒度错误归因方面的局限性。

原作者: Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Wai Tong Tsang, Chiao-Wei Hsu, T
发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Wai Tong Tsang, Chiao-Wei Hsu, Ting Wai Lam, Ho Yin Sam Ng, Chiafeng Chu, Chak-Wing Mak, Keming Wu, Hiu Tung Wong, Yik Chun Ho, Chi Ruan, Zhuofeng Li, I-Sheng Fang, Shih-Ying Yeh, Ho Kei Cheng, Ping Nie, Wenhu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ImagenWorld 的新项目,你可以把它想象成给现在的 AI 绘画和修图软件举办的一场"超级全能奥运会"。

以前的测试就像是在考“单项冠军”:有的只考“画一只猫”,有的只考“把猫变成狗”。但现实生活中的需求要复杂得多,而且以前的考试只给个分数,告诉你“不及格”,却不说“哪里不及格”。

ImagenWorld 就是为了解决这些问题而诞生的。以下是它的核心内容,用大白话和比喻来讲:

1. 这是一个什么样的“考场”?

想象一下,以前的考试只有“填空题”(根据文字画图)或“改错题”(根据文字修图)。而 ImagenWorld 是一个六边形战士的试炼场,它包含了六大类任务:

  • 怎么画:从零开始画、照着参考图画、照着多张参考图拼贴画。
  • 怎么改:照着文字改、照着参考图改、照着多张参考图改。

而且,考题的题材也包罗万象,不仅仅是画风景或人像,还包括:

  • 艺术画作(像梵高的画)
  • 照片级写实图(像真照片)
  • 信息图表(像复杂的统计图)
  • 文字图形(像海报、标语)
  • 电脑图形(像游戏里的 3D 建模)
  • 截图(像手机或电脑界面的截图)

比喻:以前的考试是让你“在纸上画个苹果”,现在的考试是让你“在一张复杂的财务报表里,把‘亏损’两个字改成‘盈利’,还要保持表格格式不乱,并且把旁边的图表颜色调成红色”。

2. 他们怎么打分?(不仅仅是给个数字)

以前的 AI 评分就像老师只给你打个"60 分”,你不知道是字写错了还是逻辑错了。
ImagenWorld 请了2 万名“人类考官”,他们不仅打分,还要写“诊断报告”

  • 找茬:如果 AI 把“猫”画成了“狗”,考官会圈出来:“这里错了,应该是猫”。
  • 找瑕疵:如果 AI 画的文字是乱码,或者图表数据对不上,考官会标记出来:“这里逻辑不通”。

比喻:这就像以前体检只告诉你“身体不好”,现在不仅告诉你“不好”,还拿着放大镜告诉你:“你的左腿膝盖有点发炎,而且你的视力在晚上有点模糊”。这种可解释的评分,能让 AI 知道自己具体哪里需要改进。

3. 他们发现了什么?(考试结果大揭秘)

他们测试了 14 个最厉害的 AI 模型(包括闭源的如 GPT-4o、Gemini,和开源的如 Flux、Qwen 等),发现了一些有趣的现象:

  • “修图”比“画画”难
    AI 很擅长从零开始画一张漂亮的图,但一旦让它去修改图片(比如“把帽子换成红色的”),它就容易犯傻。

    • 现象:有些 AI 要么直接重画了一张新图(完全忽略了原图),要么原封不动地返回原图(假装没听见指令)。
    • 比喻:就像你让厨师“把汤里的盐少放点”,结果厨师要么把整锅汤倒了重做,要么端上来还是那锅咸汤。
  • “文字”是 AI 的噩梦
    AI 在画风景、画人像时很厉害,但一遇到文字、图表、截图就抓瞎。

    • 现象:在画“信息图表”或“截图”时,AI 经常把数字算错(比如饼图加起来不是 100%),或者把文字写成乱码。
    • 例外:有一个叫 Qwen-Image 的模型,因为它专门针对“文字多的图”进行了特训(就像专门练过书法的厨师),所以在处理文字任务时表现惊人,甚至超过了某些闭源巨头。
  • 闭源 vs 开源
    像 GPT-Image-1 这样的闭源“大厂”模型,整体实力最强,像全能学霸。开源模型在“画画”上追得很紧,但在“修图”和“处理复杂逻辑”上还有差距。

4. 机器能代替人类考官吗?

论文还测试了用另一个 AI(VLM)来当考官,看它能不能代替人类。

  • 结果:机器考官在排座次(谁第一、谁第二)上做得不错,跟人类考官的排名很接近。
  • 但是:机器考官找不到具体的错误。比如它可能觉得图“还行”,但人类能一眼看出“这个人的手指多了一根”或者“这个字写反了”。
  • 比喻:机器考官像是一个裁判,能告诉你谁跑得快;但人类考官像是一个教练,能告诉你“你摆臂姿势不对,所以跑不快”。

总结

ImagenWorld 不仅仅是一个新的测试榜单,它更像是一个AI 的“体检中心”和“错题本”

它告诉我们:现在的 AI 虽然能画出很美的画,但在精细修改处理文字和逻辑方面还很笨拙。通过这种详细的“诊断”,未来的 AI 才能从“只会乱画”进化成“真正能干活”的得力助手。

一句话总结:以前我们只看 AI 画得像不像,现在 ImagenWorld 要教 AI 怎么听懂人话、改对细节、算对数字,并且告诉我们它到底哪里没做好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →