← 最新论文
💻 computer science

TECCI: Tricky Edits of Collected and Curated Images

该论文介绍了 TECCI,这是一个具有挑战性的新基准测试,由 7,550 对精心策划的图像编辑对组成,旨在系统地评估并揭示当前文本引导图像编辑模型在指令遵循、编辑最小化以及视觉质量方面的局限性,特别是针对复杂的空间和创意任务。

原作者: Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe, Sherry Ben, Jason Baldridge

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe, Sherry Ben, Jason Baldridge

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一群非常有才华的数字艺术家(AI 模型),他们以根据你的描述画出图像而闻名。你对他们说:“画一只猫”,他们做得很好。但当你要求他们做一些棘手的事情时,比如:“把猫的帽子改成一把小雨伞,但保持猫的其他部分完全不变,并确保雨伞看起来像是原本就在那里的”,情况会发生什么?

这正是这篇名为 TECCI 的论文所探讨的内容。这是一个巨大的、复杂的测试,旨在观察这些数字艺术家的真实水平到底有多高。

以下是使用简单类比对这篇论文进行的拆解:

1. 问题所在:“太容易”的测试

作者注意到,以往对这些 AI 艺术家的测试就像是给学生做一道只有简单加法题的数学测试。AI 模型拿到了满分,但当被要求做更难的事情时——比如改变时钟上的时间、移动汽车到不同的位置或重写标牌上的文字——它们仍然表现不佳。

作者意识到:“我们需要一个更难的测试,来观察这些模型究竟在哪里失效。”

2. 解决方案:一个新的秘密游乐场(数据集)

为了创建一个公平的测试,作者构建了一个全新的游乐场,名为 TECCI(收集与策划图像的复杂编辑)。

  • 新鲜食材: 不同于其他使用互联网上随处可见的照片(AI 可能在学习过程中已经“见过”了)的测试,作者在过去几年中亲自拍摄了这 1,934 张照片。这就像是给学生一本全新的、秘密的食谱,他们从未见过。
  • 菜单: 这些照片涵盖了 7 种不同的“风味”:文本、时钟、车辆、建筑、艺术、动物和自然。
  • 指令: 他们创建了 7,550 个具体的挑战。其中一些是由人类编写的,旨在变得超级难(例如“把这只猫变成黑白 Logo”),许多则是通过另一个 AI 自动生成的,以覆盖不同类型的技巧。

3. 挑战:游戏的三个规则

当 AI 艺术家尝试编辑这些照片时,评委(人类)根据三条特定的规则进行评分,就像一位严厉的艺术评论家:

  1. 你听话了吗?(指令遵循度): AI 真的按照你的要求做了吗?如果你要求一辆金色的车,它给了你一辆金色的车吗?
  2. 你弄乱了其他部分吗?(最小化修改): 这是“不要碰其他东西”的规则。如果你要求改变汽车的颜色,AI 是否也意外地改变了天空或道路?优秀的编辑就像外科医生:切口精准,不损伤健康组织。
  3. 它看起来好看吗?(视觉质量): 结果是模糊、奇怪还是有像素感?还是看起来像一张真实的、高质量的照片?

4. 结果:AI 艺术家们陷入苦战

作者在这一新测试上测试了世界上最优秀的五个 AI 模型。结果是一次现实的警示:

  • 计分板: 即使是最优秀的 AI 模型,也仅在约 22% 的任务中获得了“及格分数”。这意味着在近 10 个棘手的请求中,有 8 个请求至少违反了上述三条规则中的一条。
  • 获胜者: 一个名为 Nano Banana Pro 的模型脱颖而出,但它失败的次数仍然比成功的次数多。
  • 弱点:
    • 简单的东西: 改变颜色或简单的外观对 AI 来说是最容易的。
    • 困难的东西: 需要“思考”的事情,比如改变时钟上的时间、以逻辑方式移动物体,或者编辑复杂的建筑和自然场景,对 AI 来说非常困难。AI 经常会对空间布局(物体在 3D 空间中的位置)感到困惑。
    • “过度编辑者”: 一些模型非常擅长听从指令,但在保持图像其余部分不变方面表现很差。它们可能会把车变成金色,但也意外地把天空变成了紫色。

5. “机器人评委”(自动评分器)

由于雇佣人类来为数千张图片评分既慢又贵,作者构建了一个“机器人评委”(一个给其他 AI 打分的 AI)。

  • 这个机器人评委经过训练,能够像人类一样思考。
  • 它表现得非常准确,与人类意见的一致性达到了 75%。这意味着我们可以使用这个机器人评委快速测试未来的 AI 模型,而无需庞大的专业团队。

核心结论

论文得出结论:虽然 AI 图像编辑器正在变得更好,但它们离完美还很远。它们就像是擅长临摹绘画,但在被要求进行微小且精确的改动而不破坏整个画面时却感到吃力的学生。TECCI 数据集现在是一个公开的工具,供研究人员尝试修复这些特定的弱点,从而确保下一代 AI 艺术家能够处理这些“复杂的编辑”而不会破坏图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →