← 最新论文
💻 computer science

Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance

本文介绍了 TIGER,这是一个新颖的两阶段框架,通过优先进行字形结构恢复来指导后续的图像增强,从而解决了场景文本超分辨率中图像质量与文本可读性之间的权衡问题,并由新提出的 UZ-ST 数据集提供支持。

原作者: Minxing Luo, Linlong Fan, Wang Qiushi, Ge Wu, Yiyan Luo, Yuhang Yu, Jinwei Chen, Yaxing Wang, Qingnan Fan, Jian Yang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Minxing Luo, Linlong Fan, Wang Qiushi, Ge Wu, Yiyan Luo, Yuhang Yu, Jinwei Chen, Yaxing Wang, Qingnan Fan, Jian Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图从摩天大楼顶端阅读一个街道指示牌。那个牌子就在那里,但由于距离太远,它看起来就像一个模糊、毛糙的色块。在计算机视觉领域,这是一个经典的难题,被称为“超分辨率”(Super-Resolution)。它的艺术在于利用数学方法,将一张微小、颗粒感强、低质量的照片,推测出其清晰、高清晰度的版本应该是什么样子。通常情况下,计算机在处理自然景观时表现得相当出色——比如将一张模糊的草地照片变成清晰的照片。它们可以创造出合理的细节,如单根草叶或叶子的纹理,因为自然界充满了规律。

但文字完全是另一回事。一个模糊的字母不仅仅是一个模糊的团块,它是一段特定的代码。如果计算机对中文字符的一个笔画猜错了形状,它可能会不小心把一个表示“和平”的词变成“战争”,或者让整个词变成乱码。多年来,科学家们一直陷入了一场令人沮丧的拉锯战:如果他们试图让整张图片看起来漂亮且锐利,文字往往会变成无意义的符号;如果他们试图修复文字,背景看起来就会变得奇怪且有块状感。这就像是通过粉刷整面墙来修理一只坏掉的时钟;你可能得到了一面漂亮的墙,但时间依然是错的。

就在这时,一个研究团队带着一个被称为 TiGeSR 的巧妙解决方案介入了。他们没有尝试一次性修复整张模糊的照片,而是决定将这项工作分为两个截然不同的步骤,遵循一种“文字优先,图像随后”的理念。这就像是一位书法家和一位画家在协同工作。首先,书法家忽略杂乱的背景,全身心地投入到根据他们“认为”的文字内容,去重建完美、锐利的字母轮廓。一旦这些完美的字母形状被绘制出来,画家就会以它们作为严格的指南来填充图片的其余部分,确保背景看起来自然,同时确保字母保持在它们原本的位置。

该团队不仅发明了一种新工具,他们还意识到,要教会计算机这项技能,我们需要一个比以往任何测试都更难的测试。现有的测试就像是从几步之外观察一个标牌。研究人员构建了一个名为 UZ-ST 的新数据集,它模拟了从极端距离观察标牌的情况——比标准测试的距离远了高达 14.29 倍。这就像是要求一名学生不仅要看清房间另一头的菜单,还要看清街道另一头的菜单。

当他们将这种两阶段方法投入测试时,结果令人印象深刻。在这些极具挑战性的、超远距离缩放的图像上,TiGeSR 成功恢复了其他方法完全无法读取的文字。当其他 AI 模型要么将文字变成外星符号,要么让背景看起来像一块补丁布时,TiGeSR 保持了字母的锐利度和图像的连贯性。研究人员发现,通过明确地将“修复文字”的任务与“修复图片”的任务分离,他们可以同时实现这两个目标,证明了你并不需要在可读性和美观之间做选择——如果你按正确的顺序处理,两者皆可兼得。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →