CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions
该论文提出了名为 CREval 的自动化可解释评估框架及包含 800 多个样本的 CREval-Bench 基准,旨在系统评估复杂指令下的创意图像编辑任务,并通过用户研究验证了其指标与人类判断的高度一致性,揭示了当前模型在此类任务上的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 CREval 的新工具,以及一个配套的“考场”叫 CREval-Bench。
为了让你轻松理解,我们可以把现在的 AI 画图/改图技术想象成一群正在学艺的“数字画师”。
1. 背景:画师们遇到了什么难题?
以前,我们让 AI 改图,指令通常很简单,比如“把猫变成狗”或者“把背景变蓝”。现在的 AI 画师们(比如 GPT-Image-1, Seedream 等)在这些简单任务上已经做得很棒了。
但是,现在的用户想要更疯狂、更有创意的指令,比如:
“把这个战士变成热带鱼毛绒玩具,要有柔软的亮色花纹,还要夸张鱼鳍,但保持原来的动作,最后把它们放在沙布上,看起来像海底世界。”
这种指令非常复杂,充满了创意和细节。目前的 AI 画师们面对这种“高难度创意作业”时,经常犯三个错误:
- 听不懂人话(指令遵循差): 漏掉细节,比如忘了加鱼鳍。
- 丢了魂(视觉一致性差): 把原来的主角改得面目全非,认不出来了。
- 画得很假(视觉质量差): 图片里有奇怪的扭曲、多出来的手指或者模糊的纹理。
2. 核心问题:谁来给画师打分?
以前,我们怎么知道哪个画师画得好呢?
- 旧方法: 让另一个 AI(大语言模型)直接看画,然后打个总分(比如 85 分)。
- 缺点: 这就像让一个裁判直接喊“好”或“不好”,但说不出具体哪里好,哪里不好。而且这个裁判有时候会“偏科”,或者为了凑分乱打分,不够透明,也不够准确。
3. 解决方案:CREval(创意改图自动评分系统)
这篇论文提出了 CREval,它不再让 AI 直接“凭感觉”打分,而是换了一种更聪明的方法:“问答考试法”。
想象一下,CREval 不是直接给画师打分,而是先给画师出了一套试卷:
第一步:出题(生成问题)
系统会根据你的指令和原图,自动生成一系列具体的“是非题”(Yes/No Questions)。- 比如针对上面的“战士变鱼”指令,它会问:
- “战士变成鱼了吗?”(指令遵循)
- “原来的动作姿势还在吗?”(视觉一致性)
- “鱼鳍看起来自然吗?有没有多长出来?”(视觉质量)
- 比如针对上面的“战士变鱼”指令,它会问:
第二步:阅卷(自动评分)
系统把“原图”、“改完的图”和“问题”一起交给一个超级 AI 裁判(比如 GPT-4o)。- 裁判不需要猜,它只需要回答:“是”或“否”。
- 如果改完的图符合问题描述,就得分;不符合,就不给分。
第三步:算总分
最后,系统把所有问题的得分加起来,算出一个综合成绩。- 指令遵循 (IF): 考你有没有听懂要求。
- 视觉一致性 (VC): 考你有没有保留原图的灵魂。
- 视觉质量 (VQ): 考你画得漂不漂亮、真不真实。
比喻: 以前的评分像“盲盒”,不知道分是怎么来的;现在的 CREval 像“体检报告”,每一项指标(听力、视力、体力)都清清楚楚,告诉你哪里做得好,哪里需要改进。
4. 配套考场:CREval-Bench
为了测试这些画师,作者们还建立了一个超级题库,叫 CREval-Bench。
- 里面收集了 800 多张 极具创意的图片和 13000 多道 考题。
- 题目涵盖了 3 大类、9 种创意方向:
- 定制类: 比如把真人变成 Q 版手办。
- 场景类: 比如把物体放进雪景球里,或者做成漫画。
- 风格类: 比如把照片变成油画,或者变成乐高积木。
5. 考试结果:谁赢了?
作者用这套系统测试了目前市面上最火的 AI 模型(包括开源的和闭源的):
- 闭源模型(大厂出品): 像 Seedream 4.0 和 Gemini 2.5 表现最好,它们最听话,画得也最像样。
- 开源模型(社区出品): 像 Qwen-Image-Edit 表现也很亮眼,正在快速追赶大厂。
- 共同弱点: 所有模型在“保留原图特征”(比如不改变人物长相)这一点上,都还比较吃力,经常改着改着就“变脸”了。
总结
这篇论文就像给 AI 改图领域立了一套新的“高考制度”:
- 不再模糊打分,而是通过具体的问答来透明化评分。
- 不再只考简单题,而是专门考高难度创意题。
- 指出了方向:未来的 AI 不仅要“听话”,还要在保持原图特征的同时,画出高质量的作品。
这套系统让研究人员能更清楚地看到 AI 的短板,从而推动它们变得更强,直到能完美完成我们那些天马行空的创意指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。