← 最新论文
💻 computer science

Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition

本文提出了 RISTER,一种具有理论保证的、端到端的旋转不变性场景文本识别网络,该网络在编码器中嵌入了等变特征提取,并结合了一个经过证明的旋转不变交叉注意力解码器,从而在无需依赖显式方向估计或额外推理成本的情况下,实现了对多方向文本的最先进性能。

原作者: Zhibin Ma, Pengwen Dai, Yi Liu, Xugong Qin, Chenyun Yu, Xiaochun Cao

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhibin Ma, Pengwen Dai, Yi Liu, Xugong Qin, Chenyun Yu, Xiaochun Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人读书。通常情况下,我们会假设书本平放在桌子上,文字从左向右排列。但在现实世界中,世界是混乱的。标牌被漆在建筑物的侧面,贴纸贴在旋转的车轮上,文字可以出现在任何角度——倒置、侧向或倾斜。这就是**场景文本识别(Scene Text Recognition, STR)**所面临的挑战。这项技术让你的手机摄像头能够阅读异国他乡的菜单,或者帮助自动驾驶汽车理解路牌。

长期以来,计算机在阅读水平且笔直的文本方面表现出色。但当文本发生旋转时,计算机就会感到困惑。这就像是在尝试阅读写在一个旋转木马上的句子;如果你不先让旋转木马停下来,字母就会模糊成一团。目前大多数方法试图通过猜测文本的角度,然后在阅读前通过数学手段将其“矫正”为水平状态来解决问题。但这具有风险。如果计算机猜错了角度,整个识别过程就会失败。此外,这种方法也很慢,且需要计算机在每种可能的方向上都练习阅读同一个词,这造成了大量的无效劳动。

这引出了研究团队提出的一个新方法,他们提出了一个不同的问题:如果计算机根本不需要把文本变直呢? 如果它无论如何旋转都能读出文本呢?他们的论文题为《为可证明的多方向场景文本识别引入旋转不变性》,介绍了一个名为 RISTER 的系统。RISTER 不再试图修复图像,而是从底层构建起一种理解能力:即无论字母“A”是站立、躺下还是旋转,它依然是“A”。

“不动如山”的阅读者之魔力

研究人员使用一个由两部分组成的团队构建了 RISTER:一个编码器(Encoder,即“眼睛”)和一个解码器(Decoder,即“大脑”)

眼睛:旋转等变编码器
首先,“眼睛”需要观察图像。在过去,如果你旋转一张图片,计算机内部对该图片的映射就会变得混乱。研究人员赋予了他们的眼睛一种特殊超能力,称为旋转等变性(rotation equivariance)。你可以把它想象成一对固定在旋转转盘上的眼睛。如果转盘旋转了 90 度,眼睛也会随之旋转 90 度,因此相对于眼睛自身的图像保持完全不变。

为了实现这一点,他们使用了一种特殊的数学工具——F-Conv(基于傅里叶变换的卷积),并结合了自注意力机制(Self-Attention)(一种让计算机观察单词不同部分之间如何相互关联的方式)。这使得“眼睛”即使在整个图像倒置的情况下,也能看清字母的精细细节及其连接方式。论文证明,无论你如何旋转输入图像,眼睛创建的内部“映射图”也只会随之旋转,从而使字母之间的关系保持完美不变。

大脑:旋转不变解码器
接下来,“大脑”需要将那张映射图转化为实际的文字。在这里,论文提出了一个精彩的发现。研究人员发现,现代 AI 中使用的一种特定工具——交叉注意力(Cross-Attention),拥有一个隐藏的超能力:它是**旋转不变(rotation-invariant)**的。

想象一下,你正拿着放大镜(“查询项/Query”)对着一张地图(“视觉特征/Visual Features”)进行观察。如果你旋转下方的地图,但保持放大镜不动,你透过放大镜看到的地图部分并不会改变其身份,它只是移动到了一个新的位置。研究人员在数学上证明了,如果你保持“查询项”(大脑询问“这是什么字母?”的部分)固定,并旋转“特征”(图像数据),大脑得到的答案是完全相同的。

通过围绕这个固定的“查询项”构建解码器,并让图像数据在下方旋转,他们创造出了一个不在乎方向的大脑。它不需要猜测角度,也不需要矫正图像。它只需阅读即可。

为什么这改变了游戏规则

该论文反对传统的方法。以往的方法试图明确地猜测文本的角度,然后进行纠正。作者指出,这种方法存在缺陷,因为如果猜测错误,识别就会失败。此外,这还会浪费时间和计算资源。RISTER 完全拒绝了这种“猜测并修复”的策略。

相反,RISTER 提供了一种理论保证。作者不仅是希望它有效,还通过数学证明了对于标准角度(0°、90°、180°、270°),该系统每次都会产生完全相同的结果。对于其他角度,它的表现也近乎完美。

结果令人印象深刻。在包括具有各种奇特方向的文本图像在内的海量集合测试中,RISTER 打败了之前的最优模型。在一个多方向文本数据集上,它的准确率比排名第二的模型提高了 4.0%。更令人惊讶的是,由于该系统如此高效且稳健,它不仅提升了阅读倾斜文本的能力,同时也提升了阅读正常水平文本的能力。它在标准基准测试上也达到了最先进的性能(state-of-the-art),而且无需额外的计算能力或特殊的训练技巧(例如通过旋转图像数千次来训练模型)。

总结

这篇论文提出了一个名为 RISTER 的系统,它通过改变游戏规则解决了阅读倾斜文本的问题。它不再试图强行将文本变直,而是构建了一个天生对旋转免疫的阅读器。通过结合会随图像旋转的“眼睛”和忽略旋转的“大脑”,RISTER 能够以高精度和高速度阅读任何方向的标牌、贴纸和标签。这是一种从“解决问题”到“无视问题”的转变,而数学证明了它是行之有效的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →