← 最新论文
💻 computer science

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

本文介绍了 DrawAI,这是一个包含 DrawAI-Bench 基准测试和 DrawAI-Flow 智能体工作流的综合框架,旨在通过有效平衡视觉保真度与语义可编辑性,将位图图像重构为结构化、可编辑的图形。

原作者: Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一幅高清、精美的未来城市画作。它看起来非常棒,对吧?但现在,想象一下尝试只改变其中一个东西:比如,你想把红色的飞船换成蓝色的,或者把一座摩天大楼移到街道的另一侧。如果这张图片只是一个标准的数字照片(即“位图图像”),你就不能直接抓取并移动飞船。对于计算机来说,飞船并不是一个独立的物体;它只是与天空和建筑混合在一起的一组特定颜色点阵。要修复它,你必须重新绘制整个画面,或者从头开始创作。这就是现代 AI 生成的大多数图像所面临的挫折现实:它们虽然美丽,但是“扁平”的,导致如果不破坏整个画面,就无法进行编辑。

这篇论文处于人工智能计算机视觉领域,特别关注如何让 AI 生成的图像不仅美观,而且实用。核心思想是将一张扁平的图片变成一个“分层”文件,就像一个数字剪贴簿,其中的每一个贴纸、单词和形状都是可以拿起并移动的独立部分。研究人员正试图解决一个棘手的谜题:如何将一张扁平的照片神奇地重建为一组可编辑的部分,同时又不丢失原始外观?他们称之为“图像到可编辑重建”(image-to-editable reconstruction)。这很重要,因为随着 AI 在制作学校项目、科学论文和演示文稿方面的能力不断增强,我们需要这些视觉效果具备足够的灵活性,以便人类进行微调和改进,而不仅仅是盯着看。


这篇论文的核心思想:将扁平照片变为可编辑的乐高积木集

来自北京和清华大学的研究人员注意到一个巨大的差距。AI 现在可以绘制惊人的图片,但这些图片都处于“扁平模式”。如果你想修正一个拼写错误或移动一个图表,除非重新绘制整个画面,否则你无能为力。因此,他们创建了一个名为 DrawAI 的新系统来解决这个问题。把 DrawAI 想象成一个超级聪明的数字建筑师,它看着一张扁平的照片并说道:“我知道这看起来像一面实心的墙,但我会把它重新构建成乐高积木,这样你以后就可以把它拆解开。”

为了证明他们的系统有效,他们不仅是凭空猜测,而是建立了一个巨大的测试场,称为 DrawAI-Bench。想象一个拥有四种不同挑战类型的巨大障碍赛道:科学图表、演示文稿幻灯片、海报和流程图。他们在这个赛道中填充了 40 幅图像(每个领域 10 张真实图像和 10 张 AI 生成图像),并创建了一个包含 39 条不同规则的严格评分系统来评判结果。这些规则主要检查两件事:

  1. 保真度(Fidelity): 重建的版本看起来是否与原图完全一致?(颜色匹配吗?文字清晰可读吗?)
  2. 可编辑性(Editability): 你真的能编辑它吗?(文本是一个可以点击的真实文本框吗?箭头是一条可以移动的真实线条吗?)

论文发现,这两个目标往往是相互冲突的。如果你只是将整个图像作为一个整体块进行复制,它看起来会很完美(高保真度),但你无法编辑任何内容(零可编辑性)。如果你将其分解成太多细小的碎片,你可以编辑一切,但图片可能会变得杂乱无章,或者失去原始风格。挑战在于找到那个平衡点。

他们是如何做到的:两步走的机器人团队

研究团队并没有要求一个 AI 同时完成整个工作(这通常会导致错误),而是构建了一个名为 DrawAI-Flow 的两步工作流。他们将这个问题视为一个建筑工程,有两个专门的工人:

  1. 解析代理(侦探): 首先,这个代理观察扁平的照片,并使用特殊工具(如用于识别形状的放大镜和用于扫描文本的扫描仪)来弄清楚图片中有什么。它不仅仅是猜测;它会创建一个详细的“蓝图”或计划。它会决定:“好吧,这一部分是文本框,这是一个圆圈,这是一个需要裁剪的照片。”
  2. 重建代理(建筑师): 这个代理接过蓝图并开始建造。但酷的地方在于:它不仅仅是吐出一个最终图像,它还会编写代码(就像一份食谱)来绘制图片。它画一点,检查是否正确,如果错了,它就会修改代码并再次尝试。它会不断循环——绘制、检查、修复——直到图片完美且完全可编辑。

他们的发现:不仅仅是关于 AI 模型

团队测试了 13 种不同的 AI 模型(来自 OpenAI、Anthropic、Google 等知名机构),并使用了 5 种不同的“控制架”(harnesses)(这些类似于帮助 AI 运行的不同工具包或操作系统)。以下是他们的发现:

  • 没有单一的赢家: 没有哪一个 AI 模型是全能冠军。有些模型擅长让图片看起来真实(高保真度),但在可编辑性方面表现糟糕。另一些模型擅长编辑,但会让图片看起来有点走样。例如,一个名为 GPT-5.6 Sol 的模型在模仿原图方面得到了 94.0 分,但在可编辑性方面仅得到 85.1 分。另一个模型 Claude Opus 4.8 则相反,其可编辑性得分为 91.6,但相似度得分较低。
  • 工具包比你想象的更重要: “控制架”(运行 AI 的工具)产生了巨大的影响。使用正确的工具包可以将模型的得分提高超过 13 分。这就像是一个拿着钝锯子的熟练木匠与拿着快锯子的木匠的区别;木匠(AI 模型)是同一个人,但由于工具的不同,结果完全不同。
  • 工作流是秘诀所在: 当他们使用特殊的两步工作流(DrawAI-Flow)而不是仅仅让 AI 一次性完成时,结果有了显著提升。具体来说,可编辑性得分平均提高了 17.6 分。该工作流有助于将识别出的内容转化为实际的、可以点击和移动的独立对象。
  • 文本是最难的部分: 即便是最好的系统在处理文本时也感到吃力。虽然它们可以轻松编辑图像和形状,但将文本转化为一个真实的、可编辑的文本框对于许多模型来说仍然是一个弱点。
  • 成本与质量: 他们还研究了这需要多少成本。他们发现,投入更多资金并不总是意味着更好的结果。一些昂贵的设置实际上比便宜的设置效果更差,因为它们使用了错误的工具,或者让 AI 做了不必要的工作。

总结

论文得出结论,使图像变得可编辑不仅仅取决于拥有一个更聪明的 AI 模型。它取决于拥有一个完整的系统,包括一个好的模型、正确的运行工具以及一个智能的分步计划。你不能只是要求 AI “使这个变得可编辑”并期待奇迹发生。你需要一个负责规划的侦探和一个负责编码的建筑师,并在过程中不断检查他们的工作。

虽然该系统目前还不完美(尤其是在处理复杂的表格和密集的图表时),但它展示了一条清晰的路径。通过将问题分解并使用代码来重建图像,我们终于可以将那些扁平的、不可更改的 AI 图片转变为人类可以真正使用和改进的灵活草稿。AI 艺术的未来不仅仅是制作漂亮的图片;而是制作可以让你动手操作的图片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →