← 最新论文
💻 computer science

Scaling State-Space Models from Lines to Paragraphs: An Ablation of Mamba-based OCR

本文研究了基于 Mamba 的 OCR 从短行到全段落的可扩展性,揭示了虽然状态空间模型在合成数据上比 Transformer 具有显著的速度优势,但由于数据稀缺而非内在架构限制,它们目前在真实手写数据上的表现较差。

原作者: Merveilles Agbeti-Messan, Pierrick Tranouez, Stéphane Nicolas, Clément Chatelain, Thierry Paquet

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Merveilles Agbeti-Messan, Pierrick Tranouez, Stéphane Nicolas, Clément Chatelain, Thierry Paquet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图制造一个能够阅读手写和印刷文档的机器人,从单行文本到整页小说都能读。长期以来,最好的机器人使用的是一种名为“Transformer”的大脑。这种大脑非常聪明且准确,但它有一个重大缺陷:随着文本变得越来越长,它的速度会变得越来越慢。阅读一段话比阅读一个单词要慢得多,因为它必须不断地重新阅读它刚刚看到的所有内容才能理解新单词。这就像是在解谜题时,每放下一个新碎片,都要把之前放下的每一个碎片都重新看一遍。

这篇论文介绍了一种新型的机器人大脑,叫做 Mamba(基于状态空间模型)。Mamba 的核心承诺是它不会重复阅读过去。相反,它会保留一个“心理摘要”,记录下它目前为止所看到的内容。这意味着它阅读一段话的速度与阅读一行字的速度一样快。

研究人员想知道:这种新的 Mamba 大脑真的准备好取代旧的 Transformer 大脑来阅读长文档了吗?

以下是他们的发现,通过简单的分类进行了说明:

1. “完美世界”测试(合成数据)

首先,研究人员在“完美世界”中测试了机器人。他们喂给它干净的、计算机生成的文本(比如维基百科文章),这些文本看起来非常完美,没有任何污迹或奇怪的手写痕迹。

  • 结果: 旧的 Transformer 和新的 Mamba 都表现得极其准确(几乎完美)。
  • 速度: Mamba 是明显的赢家。它比 Transformer 快了 1.4 到 4.5 倍。文本越长,速度差距就越大。
  • 教训: 在一个干净的环境中,Mamba 是一个极佳的、闪电般的替代方案,而且不会牺牲准确性。

2. “现实世界”测试(手写体)

接下来,他们在杂乱的、现实世界的数据上测试了机器人:来自 IAM 数据库的真实手写笔记。这是情况变得复杂的地方。

  • 结果: Mamba 在这里表现得很吃力。在手写行上,它比 Transformer 出错更多。在完整的手写段落上,差距巨大:Mamba 在识别单词准确度方面几乎比 Transformer 差了近三倍
  • 类比: 想象 Transformer 是一个学生,每当遇到困难时,他都可以回头看一眼教科书(图像)。而 Mamba 是一个学生,在开始写论文之前,必须先把整本教科书背下来。如果教科书很乱(手写体),且论文很长(段落),那么那个依赖记忆的学生(Mamba)就会感到应接不暇并出错。

3. “为什么”(对数据的饥渴)

研究人员深入挖掘,试图找出 Mamba 在手写体上失败的原因。他们发现,这并不一定是由于 Mamba 的大脑“笨”,而是因为 Mamba 对数据极其饥渴

  • 实验: 当他们尝试用少量数据(例如某些数据集中仅有的 8,000 个段落)来训练 Mamba 时,机器人只是死记硬背了答案,而不是学习规则。它未能学会如何进行泛化。
  • 解决方法: 当他们给 Mamba 提供 100 万个 训练示例时,它突然开始表现完美,甚至在处理长序列时也是如此。
  • 结论: 手写体的问题不在于 Mamba “不能”做这件事,而在于我们还没有给它足够的练习材料。Transformer 更擅长从少量数据中学习,而 Mamba 需要一个庞大的案例库才能施展它的魔力。

4. 最终裁定

论文最后给出了一个明确的指南,告诉你何时使用哪种机器人:

  • 将 Mamba 用于印刷文本: 如果你正在将数百万份印刷的历史报纸或书籍数字化,Mamba 是最佳选择。它既快速又准确,还能节省大量的计算资源。
  • 对手写体保持谨慎: 如果你试图阅读杂乱的手写笔记,Mamba 目前落后于旧的 Transformer 模型,尤其是当你没有海量训练数据的情况下。
  • 未来方向: 为了让 Mamba 在手写体方面表现更好,我们需要要么喂给它更多的资料(比如 100 万个例子),要么构建一个“混合型”机器人,将 Mamba 的速度与 Transformer 从较少数据中学习的能力结合起来。

简而言之: Mamba 是一个速度极快的“速度狂”,在干净的印刷环境中表现完美,但目前它需要一个庞大的练习库才能应对复杂的手写情况。它并没有坏掉,它只是需要更多的训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →