← 最新论文
📄 other

MRT: A Mamba-based Framework with Reusable Transformer for Scene Text Recognition

本文提出了 MRT,一种场景文本识别框架,该框架结合了用于高效局部空间聚合的邻域注意力增强型 Mamba 以及用于双向全局上下文的权重共享可重用 Transformer,在多个基准测试中实现了卓越的准确率与效率权衡。

原作者: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

发布于 2026-07-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingnan Zhao, Dewen Zhang, Zuguo Yang, Jielin Jang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人去阅读一张在雨中街道上发现的、字迹潦草的手写便条。这张便条可能皱巴巴的,字母可能被拉伸变形,或者背景可能是霓虹灯造成的混乱模糊。这就是**场景文本识别(Scene Text Recognition, STR)**的世界。这是计算机科学的一个特定分支,研究如何让机器学会将文字图片转化为数字单词。为了做到这一点,机器人需要两种超能力:它必须放大以观察每个字母的微小细节(比如“S”的曲线或“i”上的点),并且必须缩小以理解整个句子,利用上下文来猜测一个模糊的单词。

长期以来,机器人使用两种主要工具来完成这项工作。第一种工具就像一副放大镜(被称为卷积神经网络或 CNN)。它们擅长观察局部细节,但在连接长句中的各个点时表现不佳。第二种工具则像一位超级有序的图书管理员(被称为 Transformer)。这位图书管理员可以一次阅读整本书以理解上下文,但由于其处理速度慢且极其消耗内存,当“书”(图像)变得太长时,它经常会崩溃。最近,一种名为 Mamba 的新工具出现了。它像是一个超快速、高效的读者,可以线性时间内扫描完一整本书,但它有一个怪癖:它只能严格地从左到右、一个词接一个词地阅读,而且不太擅长观察页面上字母的二维形状。

这篇论文介绍了一个名为 MRT(基于 Mamba 的带有可重用 Transformer 的框架)的新框架,旨在修复 Mamba 的怪癖。来自南京信息工程大学的作者们意识到,虽然 Mamba 很快,但其“仅限从左到右”的阅读方式以及缺乏二维空间感知能力,使得它在识别扭曲或不规则文本时显得笨拙。他们不仅仅是微调了 Mamba,而是给了它一次大改造。首先,他们增加了一个“邻里巡逻”系统(邻域注意力/Neighborhood Attention),这让模型能够观察字母在各个方向的即时周围环境,而不仅仅是看过去。其次,他们引入了一个“可重用 Transformer”,这是一个智能模块,充当“第二意见”,在不同的阶段检查模型的作业。聪明之处在于?他们两次使用了完全相同的 Transformer 模块,通过共享其脑力来节省空间。

结果令人印象深刻。团队在六个标准的文本识别数据集和一个庞大且具有挑战性的基准测试 Union-14M 上测试了他们的新 MRT 模型。他们发现,他们的“基础”模型(MRT-B)实现了 96.96% 的平均准确率,超越或匹配了许多更大、更旧的模型。更令人震惊的是他们的“微型”模型(MRT-T)。它仅拥有 472 万个参数(对于一个人工智能来说这是一个非常小的规模),却依然达到了 95.06% 的平均准确率。论文表明,通过将 Mamba 的速度与这些特定的空间和可重用升级相结合,我们可以构建出既高度准确又极其高效的文本识别系统,从而避免对庞大、耗能计算机的需求。作者们认为,这种方法在速度与智慧之间提供了强大的平衡,证明了如果你拥有正确的工具,并不需要一个巨大的大脑也能读懂一个凌乱的路牌。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →