← 最新论文
🤖 machine learning

A Benchmark of State-Space Models vs. Transformers and BiLSTM-based Models for Historical Newspaper OCR

该论文首次提出了基于状态空间模型(Mamba)的端到端历史报纸 OCR 架构,并通过大规模基准测试证明,相较于 Transformer 和 BiLSTM 模型,Mamba 在保持高精度(CER 约 2%)的同时,显著降低了推理时间并优化了长序列处理时的内存扩展性,为文化遗产的大规模数字化提供了高效解决方案。

原作者: Merveilles Agbeti-messan, Thierry Paquet, Clément Chatelain, Pierrick Tranouez, Stéphane Nicolas

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Merveilles Agbeti-messan, Thierry Paquet, Clément Chatelain, Pierrick Tranouez, Stéphane Nicolas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一场**“古老报纸 OCR(文字识别)界的超级马拉松比赛”**。

想象一下,你手里有一堆几百年前的旧报纸,纸张发黄、字迹模糊,有的还是哥特体(像花体字一样难认),排版也乱七八糟。你的任务是把上面的字全部变成电脑能读懂的文本。

以前的“冠军选手”是Transformer 模型(比如 DAN、TrOCR),它们像是一个超级博学的教授,读文章时会把每一个字都和其他所有字联系起来思考,所以认字非常准。但是,这个教授有个大毛病:太慢、太费脑子。如果文章太长(比如一整段),他需要把整篇文章都记在脑子里反复比对,随着文章变长,他的“脑力消耗”(内存)会呈爆炸式增长,甚至累到崩溃。

这篇论文 introduce 了一位新选手Mamba(基于状态空间模型 SSM)

1. 核心比喻:教授 vs. 高效流水线工人

  • 旧选手(Transformer/教授):

    • 工作方式: 读到一个字,就要回头看看前面所有的字,再想想后面所有的字,确保上下文完美衔接。
    • 优点: 认字极准,尤其是长文章。
    • 缺点: 就像让教授去搬砖,搬得越多,需要的桌子(内存)越大。文章越长,他越慢,甚至因为桌子不够大而直接死机。
  • 新选手(Mamba/高效流水线工人):

    • 工作方式: 他像是一个聪明的流水线工人。他不需要把整篇文章都背下来。他手里有一个**“智能记事本”**,只记住当前最需要的信息,读过一个字就把它“压缩”进记事本,然后继续读下一个。
    • 优点: 速度极快,内存占用几乎不随文章长度增加而暴涨。不管文章多长,他都能保持稳定的节奏。
    • 缺点: 在极短的文章里,可能和教授差不多快;但在超长文章里,优势巨大。

2. 比赛现场:卢森堡国家图书馆的旧报纸

作者们找来了卢森堡国家图书馆(BnL)的珍贵历史报纸作为“考场”。这些报纸有两个特点:

  1. 字很难认: 有法文、德文、卢森堡语,还有两种字体(Antiqua 和 Fraktur,后者像乱码一样难认)。
  2. 质量很差: 纸张破损、墨迹晕染。

他们不仅测试了单行文字(像一行字),还测试了整段文字(像一整段新闻),因为整段文字对模型的“记忆力”要求更高。

3. 比赛结果:谁赢了?

作者们把 Mamba 和以前的老选手(Transformer、BiLSTM)以及市面上的现成软件(如 Tesseract、Google Gemini)放在一起 PK。

  • 准确率(谁认得最准?):

    • 大家其实都挺准的!在单行文字测试中,大家的错误率都降到了 2% 左右(相当于 100 个字错 2 个)。
    • 在整段文字测试中,传统的“教授”(DAN)稍微领先一点点(错误率 5.24%),但新选手 Mamba 紧随其后(错误率 6.07%),差距非常小。
  • 速度与效率(谁跑得快、省内存?):

    • 这是 Mamba 的碾压局!
    • 速度: Mamba 比传统的“教授”快 2 倍 以上。
    • 内存(脑力): 这是最关键的。当文章变长(比如从 100 个字变成 1000 个字):
      • 教授(DAN): 需要的内存翻了 2.3 倍,像气球一样越吹越大,容易爆炸。
      • Mamba: 需要的内存只增加了 1.26 倍,像一条直线一样平稳增长。
    • 结论: 如果你要处理成千上万页的报纸,用 Mamba 就像开一辆省油的小轿车,而用 Transformer 就像开一辆耗油的大卡车,还没跑多远油就没了。

4. 其他有趣的发现

  • 现成软件不行: 像 Tesseract 或 Google Gemini 这种“通用型”软件,虽然很强大,但在面对这种几百年前的破旧报纸时,表现不如专门训练过的模型。它们就像让一个现代英语专家去读古拉丁文,虽然聪明,但没受过专门训练,容易出错。
  • 分词策略: 有些模型试图把单词拆成更小的“词块”(BPE)来加速,但在面对古德语(Fraktur)时,这种策略反而让模型“水土不服”,认字准确率大跌。这说明对于古文字,按“字”认反而更稳妥。

5. 总结:这对我们意味着什么?

这篇论文告诉我们,在数字化历史文献(如旧报纸、古籍)时,我们不需要再死磕那些“慢吞吞但聪明”的旧模型了。

Mamba 模型提供了一个完美的平衡点:

  1. 够准: 认字准确率几乎和最好的模型一样。
  2. 够快: 处理速度翻倍。
  3. 够省: 能处理超长段落而不崩溃,让大规模数字化项目变得可行且便宜。

一句话总结:
如果把数字化旧报纸比作**“在迷宫里找路”,以前的模型是“拿着整张地图反复比对”,虽然准但累死人;现在的 Mamba 模型是“手里拿着指南针,边走边看”**,既准又快,还能轻松走完长长的迷宫。这对于保护人类文化遗产来说,是一个巨大的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →