← 最新论文
🤖 AI

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

本文提出了 EdiVal,一种基于对象中心视角的自动化细粒度评估框架,通过分解图像语义对象并动态更新对象池,实现了对多轮指令图像编辑任务中指令遵循度、内容一致性及视觉质量的精准评估,并构建了涵盖多种模型与指令类型的 EdiVal Bench 基准以揭示现有模型的失败模式。

原作者: Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyua
发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 EdiVal-Agent 的新系统,它的核心任务可以比喻为:给“图片编辑 AI"请了一位极其挑剔、懂行且眼尖的“全能质检员”

想象一下,你让一个 AI 画家帮你修图。

  • 第一轮:你让它“把马变成鹿”。
  • 第二轮:你让它“把鹿的颜色从棕色改成灰色”。
  • 第三轮:你让它“把背景换成森林”。

以前的评估方法就像让一个外行或者只看大概的机器来打分:

  1. 外行打分(纯大模型):它可能会说“看起来挺像的”,但分不清鹿是不是真的变成了鹿,还是只是画了一团棕色的东西;或者它根本数不清楚到底有几只动物。
  2. 参考答案打分(对比原图):这就像让 AI 拿着标准答案去对。但问题是,标准答案本身可能也是 AI 画的,带着偏见,而且“把马变成鹿”有无数种画法,标准答案只是其中一种,这太局限了。

EdiVal-Agent 是怎么工作的呢?它像是一个拥有“超级透视眼”和“逻辑大脑”的工头:

1. 第一步:拆解图片(像乐高积木一样)

工头拿到原图后,不会把它当成一张模糊的画,而是把它拆解成一个个具体的积木块(对象)

  • 它会识别出:“这里有一个‘金属黄色的路牌’,那里有一根‘棕色的金属杆’。”
  • 它会给每个积木块建立档案,记录颜色、材质、位置。这就像给画里的每个物体都贴上了身份证

2. 第二步:生成“连环考题”

工头会根据这些积木,自动设计出一套连环编辑任务(比如:把路牌变红 -> 把杆子移走 -> 把背景换成草地)。它不是随机出题,而是确保题目是连贯的,就像玩一个“你画我猜”的升级版游戏,每一关都基于上一关的结果。

3. 第三步:三大核心考核(工头的三把尺子)

当 AI 画家交卷后,工头会用三把尺子来严格打分:

  • 尺子一:指令执行力 (EdiVal-IF) —— “听话吗?”

    • 比喻:如果你说“把棕色杆子换成灰色”,工头会拿着放大镜(物体检测器)去数:原来的棕色杆子还在吗?新的灰色杆子出现了吗?位置对吗?
    • 厉害之处:以前的 AI 容易“幻觉”(比如明明没有鹿,它却觉得有),但这个工头结合了精准检测逻辑判断,能识破 AI 的胡编乱造。
  • 尺子二:内容一致性 (EdiVal-CC) —— “乱改了吗?”

    • 比喻:你只让改杆子,工头会检查:路牌变了吗?背景变了吗?如果路牌莫名其妙变成了蓝色,工头就会扣分。
    • 厉害之处:在多轮编辑中,很多 AI 做着做着就把之前的东西给“弄丢了”或“改坏了”。这个尺子能精准抓住那些不该变却变了的细节。
  • 尺子三:视觉质量 (EdiVal-VQ) —— “好看吗?”

    • 比喻:工头会问:“这张图看起来自然吗?有没有奇怪的亮斑、手指多出来的情况?”
    • 厉害之处:它不依赖容易“眼瞎”的普通 AI,而是用了人类偏好模型,更懂人类觉得什么是“美”和“自然”。

4. 发现了什么?(质检报告)

工头给市面上 16 种流行的 AI 修图工具做了大考,发现了一些有趣的现象:

  • 全能冠军Seedream 4.0 表现最好,既听话,又不乱改东西,速度也快。
  • 进步明显GPT-Image-1.5 比它的老大哥(GPT-Image-1)强多了,特别是在多轮对话中,不再容易“失忆”或乱改东西。
  • 暴露弱点:有些开源模型(如 Qwen-Image-Edit)在第一轮表现很好,但一旦进入第二轮、第三轮,就像玩累了一样,错误越来越多(这叫“暴露偏差”),把原本没改的东西也改坏了。
  • 风格漂移:有些模型(如 GPT-Image-1)虽然听话,但喜欢“过度美化”,把原本朴素的图变得太亮、太假,失去了原本的味道。

总结

这篇论文就像是为 AI 修图界建立了一套**“标准化、自动化、精细化”的考试系统**。

以前我们只能凭感觉说“这个 AI 修图好像不错”,现在我们可以用数据告诉开发者:“你的 AI 在第三轮编辑时,有 30% 的概率会把背景里的树给删掉,而且它特别喜欢把图片调得太亮。”

这不仅能让用户知道哪个 AI 更好用,更重要的是,它像一位严师,指出了 AI 的弱点,帮助下一代 AI 修图工具变得更聪明、更稳定、更听话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →