← 最新论文
💻 computer science

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver 是一个自进化的多智能体框架,它将拒绝的数据样本转化为可操作的反馈,以迭代优化富文本图像数据集,在 OCR 准确度和文本渲染质量方面显著优于静态数据流水线。

原作者: Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人艺术家去画包含可读文本的图片,比如面包店上的招牌或黑板上的菜单。这对计算机来说极其困难,因为它们经常把字母画错,让它们看起来像乱码,或者忘记把文字放在正确的位置。

长期以来,人类教导这些机器人的方式就像是一个单向装配线

  1. 收集: 我们从互联网上抓取数百万张图像。
  2. 过滤: 我们扔掉那些糟糕的图像(模糊、无法阅读、主题错误)。
  3. 冻结: 我们将“好”的那一堆锁起来用于训练机器人。
  4. 丢弃: “坏”的那一堆被扔进垃圾桶。

问题在于: 这篇论文指出,扔掉“坏”的那一堆是一个巨大的错误。那些被拒绝的图像实际上充满了线索!它们能准确地告诉我们哪里出了问题(例如:“机器人总是把‘menu’这个词和倒过来的‘menu’搞混”或者“它处理不了手写招牌”)。通过忽略这些,机器人会一遍又一遍地犯同样的错误。

解决方案:DataEvolver(自我进化的团队)

作者创建了一个名为 DataEvolver 的新系统。它不再是单向的装配线,而是一个不断循环、从错误中不断学习的四人团队。把它想象成一组正在共同完善一本书的编辑和作家。

以下是这四个智能体是如何工作的:

  1. 检索者 (The Retriever - 侦察兵):

    • 角色: 根据团队的需求寻找候选图像。
    • 类比: 就像收集原材料的侦察兵。如果团队需要更多“手写招牌”,侦察兵就会去寻找这类素材。
  2. 验证者 (The Verifier - 检查员):

    • 角色: 检查每一张图像。它决定文本是否可读以及图片是否合理。它将图像分为“通过”堆和“拒绝”堆。
    • 类比: 就像工厂里的质量控制检查员。如果一个招牌有拼写错误,他们会盖上“失败”的印章。至关重要的是,他们会写下失败的原因(例如:“模糊”、“字体错误”、“缺失文本”)。
  3. 评论家 (The Critic - 策略师):

    • 角色: 这是整个运作的大脑。它查看检查员所有的“失败”印章。它不会简单地扔掉那些错误的图像,而是阅读笔记并说道:“嘿,我们在手写招牌上一直失败。下次,告诉侦察兵去找不同的书写风格。”
    • 类比: 就像是在复盘比赛录像的教练。教练不会只说“你输了”,他们会说:“你在左侧总是被拦截;下一场比赛,请调整阵型向右移动。”评论家将失败转化为策略更新
  4. 生成器 (The Generator - 构建者):

    • 角色: 有时,侦察兵找不到足够多的特定例子(比如某种特定的复古菜单)。这时生成器就会介入,专门为这些缺失的环节创造新的图像。
    • 类比: 如果图书馆缺少关于“1920年代爵士乐”的书籍,构建者就会针对这个主题编写新的故事来填补空白。

他们如何协同工作(循环过程)

团队按轮次进行工作:

  1. 侦察兵带来图像。
  2. 检查员检查图像并标记失败项。
  3. 策略师分析失败原因,并为下一轮更新规则(例如:“停止寻找蓝色招牌;寻找红色的招牌”)。
  4. 构建者在侦察兵无法找到足够样本的空白处进行填充。
  5. 团队带着这些更聪明的新规则开始下一轮。

测试结果如何?

研究人员测试了这个系统,使用 DataEvolver 生成的数据与传统的“单向”方法生成的数据,分别训练了两个不同的机器人艺术家(称为 PixArt-α 和 Show-o2)。

  • 结果: 使用 DataEvolver 训练的机器人画出的文本可读性显著提高
    • 在一项测试(TextScenesHQ)中,其文本可读性的提升幅度巨大:相比于之前最好的方法,实现了 85% 的飞跃
    • 在另一项测试(LongTextBench)中,它提升了 35%
  • 为什么有效: 论文发现,“坏”图像其实是金矿。通过分析图像为何失败,系统学会了在下一轮中避免这些特定的错误。其中,“评论家”智能体是最重要的部分;如果没有它,系统就无法从错误中学习。

核心启示

该论文声称,拒绝是有用的。在旧的方法中,一张失败的图像仅仅是垃圾。但在 DataEvolver 中,失败的图像是一个教训。通过将数据构建视为一个能够从自身错误中学习的自我进化过程,他们创造出了一个更聪明的数据库,用于教机器人绘制富含文本的图像。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →