想象你是一家大型高科技摄影棚的导演。你拥有一支由 AI 艺术家(即图像编辑模型)组成的团队,以及一支由艺术评论家(即奖励模型)组成的团队,他们的职责是对艺术家们的作品进行评分。
长期以来,这家摄影棚的评分系统存在两大问题:
- 测试过于简单:评论家只要求艺术家完成简单的任务,例如“把天空变成蓝色”。即使艺术家是天才,这项测试也无法真正展现他们的智慧。
- 评论家脱离实际:评论家是在与艺术家实际工作不符的虚假场景中进行训练的。当事情变得复杂时,他们无法区分好的编辑和糟糕的编辑。
本文的作者,Edit-Compass和EditReward-Compass,构建了一个全新的、极其严格的训练场和评分系统来解决这些问题。
1. 新的训练场:Edit-Compass
将Edit-Compass想象成"AI 艺术家的健身房”。AI 不再只是举轻重量,而是必须应对 36 个不同且难度递增的挑战。
- 基础(通用任务):“把猫放在桌子上。”(简单)
- 动态内容:“让猫跳过桌子。”(更难)
- 脑筋急转弯(世界知识与推理):这里变得棘手。AI 必须理解现实世界的逻辑。
- 示例:“如果图片中在下雨,雨伞会发生什么?”或者“解出黑板上画着的这个数学谜题。”
- 示例:“在这个字母网格中找到最长的单词,但你只能向下或向右移动。”
- 小组项目(多图像):AI 必须查看三张不同的照片,并将它们融合成一个完美的场景,例如从照片 A 中提取人物的脸部,从照片 B 中提取衣服,从照片 C 中提取背景。
新的评分系统:
新系统不再仅仅给出“好”或“坏”的分数,而是使用评分标准(详细的检查清单)。它要求 AI 评论家逐步思考:
- 你实际上是否完成了所要求的内容?(指令遵循意识)
- 你是否弄糟了那些你不该触碰的部分?(视觉一致性)
- 最终的图片看起来自然,还是像一团混乱的故障?(视觉质量)
2. 新的评论家:EditReward-Compass
当艺术家们正在训练时,他们需要一位评判者来告诉他们两次尝试中哪一次更好。这就是EditReward-Compass发挥作用的地方。
想象 AI 艺术家尝试以两种不同的方式编辑一张照片。奖励模型(评论家)必须观察这两种方式,并说:“选项 A 优于选项 B。”
论文发现,旧的评论家在这方面表现不佳。他们经常感到困惑或带有偏见。新的基准测试模拟了现实生活中的场景,评论家必须不断做出这些艰难的选择。事实证明,目前最好的“评论家”并不是那些专门受训成为评论家的模型,而是原生多模态模型(全能型的智能 AI 大脑),它们能够自然地“看”和“思考”。
3. 他们的发现(结果)
作者将 29 种不同的 AI 艺术家和 21 种不同的 AI 评论家投入了这项新的、严苛的测试。以下是他们的发现:
- 差距真实存在:“科技巨头”的闭源模型(如那些秘密的、极其昂贵的模型)与开源模型(任何人都可以下载的模型)之间存在巨大差异。闭源模型就像职业运动员,而开源模型则像有天赋的业余爱好者,但在处理困难任务时仍会绊倒自己的脚。
- “大脑”薄弱:即使是最好的 AI 模型,也擅长处理简单的事情(改变颜色、移除物体)。但是,当你要求它们使用逻辑(如解决图片中的数学问题)或世界知识(如了解化学反应看起来是什么样)时,它们就会挣扎。它们就像一位能完美复制照片的画家,却不理解汽车引擎是如何工作的。
- “评论家”的惊喜:论文发现,通用 AI 模型(那些既能聊天又能看图的模型)实际上比专门为该任务构建的专用“奖励模型”更擅长评判图像编辑。这就像发现一位普通艺术教授比一位只研究笔触的专家更能评判一幅画作。
结论
这篇论文不仅建立了一个更难的测试,还构建了一个指南针,向我们精确展示技术在哪里强大,在哪里迷失。它告诉我们,虽然 AI 图像编辑已经取得了长足的进步,但在真正掌握复杂编辑之前,它仍需学习如何“思考”并理解现实世界。
技术摘要:Edit-Compass 与 EditReward-Compass
问题陈述
近期的图像编辑模型在指令遵循、多模态理解以及复杂视觉操作方面取得了显著进展。然而,该领域仍面临两个关键的评估缺口:
- 图像编辑基准:现有基准往往无法忠实反映人类判断,尤其是针对前沿模型。这归因于任务难度不足以及评估协议过于粗糙,无法区分细微的能力差异。此外,许多基准依赖自动化指标或简单的多模态大语言模型(MLLM)提示,缺乏与复杂场景中人类推理的一致性。
- 奖励模型基准:随着强化学习(RL)成为优化图像编辑的核心,对奖励模型的可靠评估至关重要。当前的奖励模型基准存在分布不匹配问题;它们通常基于静态的跨模型比较来评估模型,而非模拟 RL 优化过程中遇到的现实、模型内候选分布(例如 FlowGRPO 场景)。
方法论
作者引入了一个统一的评估套件,包含用于图像编辑模型的 Edit-Compass 和用于奖励模型的 EditReward-Compass。
1. Edit-Compass(图像编辑基准)
- 规模与范围:包含 2,388 个精心标注的实例,涵盖 36 个细粒度任务类别,跨越六个渐进式挑战维度:
- 通用任务:主体添加、移除、替换、提取、颜色/大小/材质更改、风格迁移和文本编辑。
- 动态操作:物体移动、交换、交互、动作改变和情绪修改。
- 世界知识推理:时间、因果、游戏、数学和化学推理任务。
- 算法视觉推理:需要多步逻辑推导的任务,例如最优路径识别、凸包识别、背包选择以及网格中的单词发现。
- 多图像任务:合成、虚拟试穿以及多图像感知(跨图像转移属性)。
- 复杂任务:复合指令以及“复杂绘画”任务,用户除文本外还提供视觉线索(箭头、圆圈、遮罩)。
- 数据构建:采用混合方法。通用任务和复杂任务使用真实世界图像,指令由大语言模型(LLM)生成并经人工验证。动态任务、世界知识任务和多图像任务由专家设计,源图像通过优化后的提示生成。算法任务通过程序化生成,其真实标注源自算法解决方案(例如 Dijkstra 算法、动态规划)。
- 评估框架:采用基于三个核心维度的细粒度、多维度框架:
- 指令感知:指令遵循和世界知识感知。
- 视觉一致性:未编辑区域的一致性和身份一致性。
- 视觉质量:自然度、结构保真度和伪影严重程度。
- 机制:采用“MLLM 作为裁判”的流程,结合结构化的思维链推理和具体的评分标准(1–5 分制),生成标量分数和可解释的推理依据。
2. EditReward-Compass(奖励模型基准)
- 规模:包含 2,251 个偏好对,每个偏好对由一个编辑指令和两个候选编辑图像组成。
- 采样策略:旨在模拟现实的 RL 优化场景。它采用受 FlowGRPO 启发的策略,利用随机微分方程从多样化模型(包括开源和专有模型)中采样候选输出。这确保了评估反映的是策略优化过程中发现的模型内候选分布,而不仅仅是跨模型比较。
- 标注:严格的三阶段人工标注流程(注:原文为 two-stage,但描述涉及八位专家,此处忠实翻译原文流程描述)涉及八位专家,确保偏好对具有高质量,并在指令遵循和视觉一致性方面存在清晰的差异。
关键结果
作者评估了 29 个前沿图像编辑模型和 21 个奖励模型。
图像编辑模型
- 专有模型与开源模型:存在显著的性能差距。表现最佳的专有模型(Nano Banana Pro)总得分为 3.99,而最强的开源模型(Qwen-Image-Edit)得分为 2.69。
- 特定任务弱点:虽然开源模型在基础任务(通用、动态操作)上表现具有竞争力,但在以下方面存在显著困难:
- 世界知识推理:(Nano Banana Pro: 3.89 vs. Qwen-Image-Edit: 1.74)。
- 算法视觉推理:大多数模型得分接近基线(1.0–1.5),表明其无法进行深度视觉推理和忠实执行算法编辑。
- 多图像编辑:闭源模型在跨图像理解和合成方面显示出明显优势。
- 语言:许多模型表现出跨语言不平衡(英语表现更好),尽管先进的统一模型显示出更均衡的能力。
奖励模型
- 原生 MLLM 与专用模型:原生多模态大语言模型(例如 Qwen3.5-9B、Qwen3.6-27B)的表现优于现有的、专门在偏好数据上训练的开源奖励模型(例如 EditScore、EditReward)。
- 扩展与推理:较大的模型通常表现更好。启用“思考”(思维链)推理始终能提升奖励模型的性能,稀疏混合专家(MoE)模型的增益高达 10.56 分。
- 评估协议:EditReward-Compass 中使用的结构化提示显著提升了评估性能,优于之前的基线(例如 EditScore 提示),增益高达 12.93%。
意义与主张
本文声称提供了一个全面且与人类对齐的框架,用于评估前沿图像编辑系统和奖励模型。其意义在于:
- 忠实评估:通过引入渐进式挑战任务和基于推理的细粒度评估,该基准揭示了当前模型中持续存在的弱点(特别是推理和世界知识方面),而这些是粗糙基准所忽略的。
- RL 对齐:EditReward-Compass 弥合了静态评估与动态 RL 优化场景之间的差距,为分析奖励引导的优化提供了现实测试平台。
- 未来方向:结果表明,虽然浅层的感知级编辑正在成熟,但该领域必须专注于更深层的推理、世界知识整合以及复杂的多图像操作。此外,原生多模态大语言模型似乎比仅在偏好数据上训练的专用、小规模模型,是奖励建模更有前景的基础。
作者承认了局限性,指出他们依赖基于 API 的 MLLM 裁判,这可能会引入变异性。他们提出未来的工作将开发专用的图像编辑裁判模型,以确保在没有专有依赖的情况下进行更稳定和透明的评估。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。