← 最新论文
🤖 AI

FP-THD: Full page transcription of historical documents

本文提出了 FP-THD,这是一个将布局分析与扩展文本行识别模型相结合的流水线,旨在高效转录 15 和 16 世纪的拉丁语历史文献,同时保留其手写、印刷及多语言格式中的原始字符、符号和布局。

原作者: H Neji, J Nogueras-Iso, J Lacasta, MÁ Latre, FJ García-Marco

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: H Neji, J Nogueras-Iso, J Lacasta, MÁ Latre, FJ García-Marco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台时光机,可以缩放进入一本有着500年历史、用中世纪拉丁文书写的尘封古籍。书页皱巴巴的,墨迹已经褪色,那手写体是由各种圈圈、线条和奇怪符号组成的,看起来与我们今天使用的字母完全不同。如果你尝试用现代计算机来阅读它,就像是在要求一个机器人去理解一段它从未学习过的秘密代码。它可能会把一个长得像“f”的“长s”识别成“f”,或者把两个字母合并成现代的“ae”,从而完全破坏了历史的原貌。

于是有了 FP-THD,这是一个由研究团队设计的新型数字流水线,旨在成为终极的“时空图书管理员”。他们的目标不仅是阅读文字,更是要保留原始页面的精确外观和感觉,包括那些对于历史学家至关重要的复杂缩写和特殊符号。

两步舞曲:先找行,再读行

作者意识到,试图一次性阅读整个混乱的页面就像试图一口吞下一整个披萨。因此,他们构建了一个由两个截然不同的步骤组成的流水线,就像一支专家团队。

第一步:布局侦探 (ParseNet)
首先,系统使用一个名为 ParseNet 的工具来充当布局侦探。它扫描整个页面图像,并在每一行文本周围画出隐形的方框,确定段落的起始和结束位置,即使这些行是弯曲或倾斜的。这就像一位机器人图书管理员,仔细勾勒出混乱页面上每一句句子的轮廓,并将它们切割成整齐、笔直的条带。这一步会生成一张地图(采用 PAGE XML 格式),告诉计算机确切的观察位置。

第二步:超级阅读者 (Masked Autoencoder)
一旦行被切割并拉直,它们就会被交给第二位专家:一个由 Vision Transformer 驱动的 掩码自编码器 (Masked Autoencoder)。把这个模型想象成一个通过玩“填空游戏”来学习阅读的超级聪明学生。

这个游戏的规则是这样的:计算机获取一行文本,遮住其中的随机片段(就像用便利贴盖住几个单词),然后根据周围的线索尝试猜出被遮住的内容。通过在不同类型的书写体上进行数百万次的这种练习,该模型学会了不仅能识别现代字母,还能识别那些奇特的各种中世纪符号、连字(如“æ”)以及表示字母缺失的波浪号(~)。

大考:手写体 vs 印刷体

团队不仅构建了这个系统,还通过三个不同的“训练营”(数据集)对其进行了严苛测试:

  1. Rodrigo (手写体): 一个包含 853 页 1545 年古西班牙手写体的集合。
  2. Bentham (手写体): 哲学家杰里米·边沁(Jeremy Bentham)的著名信件,以其各种杂乱无章的手写风格而闻名。
  3. Molino (印刷体): 团队自行创建的一个全新数据集,包含 143 页 1500 年代和 1600 年代的法律文本,充满了拉丁语缩写。

结果:表现如何?

论文显示,这种方法非常有效,尤其是在与其他工具对比时。

  • 对于 Rodrigo 手写体: 当批处理大小为 128 时,该模型的字符错误率 (CER) 为 1.30%词错误率 (WER) 为 6.97%。这意味着它几乎正确识别了每一个字母!这优于一些使用额外复杂步骤来纠错的高科技模型。
  • 对于 Bentham 手写体: 它的 CER 为 4.46%WER 为 7.68%。虽然这比 Rodrigo 的结果略高,但作者指出,它是在没有使用任何花哨的后处理技巧或外部语言指南的情况下完成的,这在效率方面意义重大。
  • 对于 Molino 印刷文本: 这是真正的亮点。团队在 10 页 Molino 数据集上测试了他们的系统,并将其与另外两种方法进行了比较:一种是流行的开源工具 Pero-OCR,另一种是来自 Biblioteca Virtual del Patrimonio Bibliográfico (BVPB) 的转录文本(使用了商业软件)。
    • BVPB 转录文本的 CER 为 0.3379,WER 为 0.6835
    • Pero-OCR 的 CER 为 0.0242,WER 为 0.2106
    • FP-THD 取得了最低的错误率:CER 为 0.0178WER 为 0.0450

用通俗的话说,这个新系统比商业软件和另一个开源工具犯的错误更少,与 Pero-OCR 相比,它将词级错误降低了近 80%,与 BVPB 转录相比则降低了超过 90%。它在保留那些关键的中世纪波浪号和缩写方面也做得更好。

它目前还做不到什么

作者坦诚地说明了他们“魔法”的局限性。该系统擅长阅读页面中间的主体文本,但在以下方面有时会遇到困难:

  • 边缘注记: 那些在页面边缘的小字可能会被遗漏或转录错误。
  • 单个单词: 如果一行文本只有一个单词,模型有时会感到困惑,因为它的训练主要基于长行文本。

总结

这篇论文并不声称已经永久解决了阅读历史的问题。相反,它表明通过结合一个“布局侦探”和一个“填空式”阅读者,我们可以创造出一个高度准确、免费且尊重原始风格的历史文献处理工具。它证明了你不需要将古老的拉丁语转化为现代文本就能理解它;你可以保留旧有的风格,而计算机依然能够阅读。

该团队计划通过在训练数据中加入更多孤立单词来不断改进,并最终使用该系统自动展开缩写并将拉丁语翻译成西班牙语。但就目前而言,他们已经证明了通过正确的流水线,即使是最混乱的中世纪页面也可以转化为整洁的数字文本,且不失其灵魂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →