2D Rotary Position Embedding for Scene Text Recognition with Transformers
本文介绍了 \method{},这是一种针对场景文本识别的无参数化 2D 旋转位置嵌入(Rotary Position Embedding)适配方法,它通过各向异性地分配维度以匹配文本长宽比,并将旋转耦合扩展到编码器-解码器交叉注意力机制,从而解决了现有方法的局限性,并显著提高了在弯曲、旋转及透视畸变文本布局上的准确率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字视觉的繁荣世界中,机器正在不断学习如何阅读我们周围的世界。从扫描高速公路上的车牌到翻译异国城市的街道标牌,在自然场景中识别文本的能力是现代技术的基石。多年来,当文本不是完美的直线或印在洁白的纸张上时,计算机在处理这项任务时一直感到吃力。现实世界的文字往往会因为摄像机的角度而产生弯曲、倾斜或拉伸,这创造了一个标准阅读算法难以解决的视觉谜题。为了帮助计算机理解字母的顺序,研究人员长期以来一直依赖于一种位置标签系统。把这些标签想象成一个简单的地址系统,它告诉计算机哪一个字母是第一、第二和第三个。虽然这对于笔直的水平文本非常有效,但当文本弯曲或扭曲时,这种方法就会失效,因为计算机失去了追踪字母在二维空间中相互关系的手段。
一位研究人员现在开发了一种赋予计算机这种空间感知能力的新方法,专门针对现实世界中那些杂乱、不规则的文本。他们创建了一种名为“二维旋转位置嵌入”(2D Rotary Position Embedding)的方法,用一种动态理解位置的方式取代了旧的一维地址系统。这种新方法不再仅仅是沿着单条线计数,而是允许计算机根据字母之间的垂直和水平距离来旋转其对位置的理解。这意味着即使单词是环形书写的,或者从陡峭的角度观察,机器也能识别出某个字母是位于另一个字母“旁边”。他们在六个不同的标准图像集上测试了这个系统,这些图像集包含了从弯曲标牌到透视变形广告牌的一切内容。结果显示,这种新方法显著优于以往的技术,尤其是在处理不规则文本时。这种改进在最具挑战性的图像上最为显著,新系统正确识别了旧模型误读的单词,且没有给计算机的大脑增加任何额外的复杂性或内存成本。
这项进步的核心在于计算机处理图像的方式。传统方法通常将图像压平为一条单一的长数据线,忽略了文本存在于具有高度和宽度的平面这一事实。当文本弯曲或倾斜时,这种压平过程会扭曲字符之间的关系,导致计算机迷失方向。然而,新方法将图像视为一个真正的二维网格。它为图像的每个部分分配了一个独特的空间签名,这个签名会根据字母的相对位置而变化。如果一个字母位于另一个字母的右上方,系统就能理解这种特定的几何关系,无论整个单词如何扭曲。这是一个至关重要的区别,因为它允许计算机遵循阅读的自然流向,即使这个流向并非一条水平直线。
研究人员通过使用相同的训练数据和硬件,将他们的新系统直接与旧模型进行对比,展示了这种方法的威力。在一个引人注目的例子中,一个使用旧方法的模型在观察一个写着“coffee”的弯曲标牌时,将其读成了“come”,因为它完全漏掉了字母,因为曲线破坏了它的线性计数。而使用二维空间旋转的新系统则正确读出了单词。这并非孤立事件。在数千张测试图像中,新系统一致地解决了旧系统失败的问题,尤其是在以难以处理的变形著称的数据集上。在一组包含弯曲文本的图像集上,新方法的准确率比之前的最佳模型提高了近四个百分点。在具有透视变形(即文本看起来向远处退去)的图像上,它也表现出了类似的增益。
这项发现之所以如此优雅,在于其简洁性。研究人员不需要重新设计整个计算机架构,也不需要添加数百万个新参数使其工作。新的位置系统就像一个可以插入现有阅读软件的插件模块。它几乎不需要额外的内存,仅通过在系统的设置中添加两个微小的数字即可调整以适应文本的形状。这种效率表明,阅读不规则文本的瓶颈不在于计算能力的缺乏,而在于计算机理解空间的方式存在缺陷。通过修复这个特定的几何理解偏差,研究人员实现了一个显著的性能飞跃。
研究还包括了对系统为何奏效的详细分析,利用可视化工具观察计算机在阅读文本时是在“看”哪里。这些可视化结果显示,新方法使计算机能够紧密地聚焦在字母的笔画上,即使在笔画呈弧形或倾斜时也能跟随其路径。相比之下,旧模型往往会被背景分散注意力,或者在几何形状改变时丢失字母序列的追踪。研究人员发现,当系统将更多的处理能力分配给文本的垂直维度时,效果最为显著,这反映了文本行通常比它们的高度要宽的事实。这种与单词自然形状相匹配的小幅调整,被证明是其成功的关键因素。
尽管新方法代表了向前迈出的重要一步,但研究人员也承认它并非适用于所有可能的形状。该系统旨在很好地处理水平和垂直关系,但在处理高度对角线或复杂的非线性排列的文本时仍可能面临困难。他们建议未来的工作可以扩展这一理念,以处理更多样化的角度,并潜在地应用于视频领域——即文本在三维空间中移动的情况。然而,目前来看,这些发现提供了一个清晰且实用的改进,让机器能够阅读真实世界中的景象,而不是一个简化的直线。通过教导计算机尊重文本真实的几何结构,这项研究让我们离这样一个未来更近了一步:数字系统可以阅读任何标牌、任何标签和任何笔记,无论其书写方式如何,也无论其出现在何处。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。