← 最新论文
💻 computer science

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

本文提出了一种自提示扩散变换器,该模型利用上下文学习,通过直接从原始图像构建样式和字形提示来实现开放词汇且风格一致的场景文本编辑,从而克服了现有方法依赖预训练字形编码器并忽视视觉细节的局限性。

原作者: Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一张写着“Café”的街道标志照片,但你想把它改成“Bakery”。棘手之处不在于写出新词,而在于确保新词看起来仿佛一直就在那里。它需要匹配完全相同的字体、特定的红色色调、油漆的纹理,以及光线照射在字母上的方式,同时保持背后的砖墙看起来完好无损。

本文介绍了一种名为MSTEdit的新型 AI 工具,它能做到这一点,但在学习方式上有一个巧妙的转折。

问题所在:“空白画布”的谬误

以往尝试完成这项任务的方法,就像一位被要求修正标志上拼写错误的画家,却被迫先用一块空白的白色画布覆盖整个标志。

  • 旧方法:AI 会完全擦除原始文本,然后仅根据周围的墙壁来猜测新文本应该是什么样子。
  • 结果:新文本往往看起来不对劲。它可能使用了错误的字体、错误的颜色,或者看起来像贴在上面的贴纸。它失去了原始标志的“灵魂”。此外,这些旧系统就像只死记硬背特定字典的学生;如果你要求它们写出一个从未见过的词(比如生僻符号或新语言),它们就会失败。

解决方案:“自提示”侦探

作者提出了一种名为**自提示(Self-Prompting)*的方法。AI 不再擦除原始文本并猜测,而是像侦探一样,在做出任何更改之前*先研究“犯罪现场”。

以下是其工作原理,使用一个简单的类比:

1. “风格快照”(风格提示)
想象你想把单词"Café"改成"Bakery"。在触碰标志之前,AI 会拍摄原始"Café"字母的高分辨率照片。它会分析油漆纹理、确切的红色色调和字体风格。它会创建一个“风格快照”,并说:“好的,新词必须看起来完全像这样。”

2. “蓝图”(字形提示)
AI 还会获取新单词"Bakery",并绘制其简单的黑白蓝图。这不是一张花哨的照片;它只是字母的清晰轮廓。这告诉 AI写什么,但尚未告诉它该如何呈现

3. “大师艺术家”(扩散变换器)
AI 使用一个强大的引擎(称为多模态扩散变换器),该引擎非常擅长“上下文学习”。可以将此引擎想象为一位极其擅长模仿风格的大师艺术家。

  • 艺术家查看蓝图(写什么)。
  • 艺术家查看风格快照(如何写)。
  • 艺术家查看周围墙壁(放在哪里)。

然后,艺术家直接在墙上绘制新单词"Bakery",利用蓝图构建结构,但复制原始"Café"的油漆和纹理。

训练:在实践中学习

他们是如何训练这个 AI 变得如此出色的?他们使用了一个称为**“冷却训练(Cooldown Training)”**的两步训练过程。

  • 第一步:自监督阶段(练习赛):首先,他们让 AI 在数百万张图片上进行练习,只需学习如何一般性地绘制字母。它在许多不同语言中学习了字母的形状,而无需担心匹配特定风格。
  • 第二步:冷却阶段(期末考试):然后,他们给 AI 提供了一小组特殊的“前后”图片对。在这些图片中,人类仔细编辑了标志以展示完美的结果。AI 研究这些图片对,学习匹配风格的微妙艺术。它学会了:“啊,当我在旧词上看到这种红色油漆纹理时,我必须在用新词时也使用相同的红色油漆纹理。”

为何它与众不同

  • 开放词汇:因为 AI 学习的是笔画的形状(构成字母的线条),而不是死记硬背固定的单词列表,所以它几乎可以编辑任何语言中的文本,甚至是它从未见过的语言。它可以处理其他 AI 会卡住的生僻字符或符号。
  • 无需额外工具:与其他需要单独、庞大的工具来分析字体或颜色的方法不同,该方法直接从图像本身构建这些“提示”(风格快照和蓝图)。它是自包含的。
  • 真实效果:该论文在 13 种不同语言(包括英语、中文、阿拉伯语、泰语和俄语)上测试了该方法。结果表明,与任何先前的方法相比,他们的方法在使新文本看起来准确并匹配原始风格方面要出色得多。

简而言之,这篇论文展示了一种 AI,它不仅仅是“替换”文本;它“移植”文本,确保新词完美地融入现有场景,看起来仿佛天生就属于那里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →