TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents
TongGuOCR 是一种新颖的布局感知且基于 Token 增强的 OCR 框架,旨在通过利用用于连贯识别块的预处理模块以及用于扩展生僻字词汇并建模空间转换的 Token 增强识别模块,从而在具有挑战性的基准测试上显著超越现有的传统及多模态模型,以此实现对中国历史文献的准确转录。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名侦探,正试图阅读一本千年前的日记。然而,书页上布满了灰尘,墨迹已经褪色,字迹也如此奇特,以至于连你最聪明的伙伴都无法辨认出这些字母。这就是历史学家在解读中国历史文献时每天面临的挣扎。几个世纪以来,这些珍贵的文本一直被困在扫描图像中——这些是计算机可以“看到”但无法像人类一样“阅读”的纸张图片。为了将这些图片转回可搜索的文本,科学家们使用了一种叫做光学字符识别(OCR)的技术。把 OCR 想象成一个超级快速的机器人图书管理员,它看着一页书的照片,然后打出它看到的文字。然而,当这个机器人遇到布局混乱、符号怪异或句子在页面上以令人困惑的模式跳跃的古籍时,它往往会迷失方向、跳行或者输入乱码。
正是在这里,一个名为 TongGuOCR 的新研究团队提出了一个聪明的解决方案。他们意识到,教机器人阅读这些书的旧方法就像试图一口气吃掉一整张披萨;这太乱了,机器人无法处理其中的细节。相反,他们构建了一个系统,首先将披萨切成完美的、易于处理的小块(布局感知预处理),然后教机器人一种特殊的“新语言”,以理解这些小块上那些奇怪且罕见的食材(词元增强识别)。通过结合这两个技巧,他们创造了一个不仅是在猜测单词,而且实际上能理解古文流动逻辑的机器人,即使这些文本是以垂直列形式书写或散落在页面各处时也是如此。
问题所在:为什么古籍会让机器人“罢工”
中国历史文献是文化的宝库,但它们很难阅读。它们的布局通常很复杂,例如文字纵向排列、注释(小字笔记)挤在行间,且阅读顺序并不总是从左到右或从上到下。此外,这些书籍充满了“生僻字”——即那些在现代字典中并不存在的古代符号。
当标准的 AI 模型尝试阅读这些页面时,它们面临着三个大难题:
- 布局混乱: 如果机器人一次看整个页面,图像会变得模糊,并且会丢失附近文字的上下文信息。如果它一次只看一行,它就会失去全局观,并对下一步该去哪里感到困惑。
- 生僻字问题: 现代 AI 是基于今天的语言进行训练的。当它看到一个古代的生僻字符时,它往往会将其分解成微小的、毫无意义的碎片(就像试图通过猜测单个字母而不是识别整个单词来拼写单词一样)。这使得准确识别字符变得非常困难。
- “下一步去哪?”的困惑: 在读完一行后,机器人通常不知道是应该跳到下一行、向右移动,还是去看边注。如果没有清晰的地图,它就会跳行或以错误的顺序阅读。
解决方案:TongGuOCR 的两步魔法
来自华南理工大学和华为的研究人员提出了 TongGuOCR,这是一个专门为解决这些古代谜题而设计的框架。他们不仅仅是投入更多的计算能力,而是改变了机器人“看”和“思考”文本的方式。
第一步:智能切片器(布局感知预处理)
想象你在读一份密密麻麻的报纸。如果你试图阅读整个页面,你的眼睛会疲劳;如果你一次只读一个词,你会失去意义。TongGuOCR 使用一个“智能切片器”将页面切割成识别块。
该系统并非只是简单地切直线,而是观察页面并将连续的文本行组合成整齐、连贯的块。这就像一位厨师小心翼翼地将蛋糕切成完美的、一口大小的块,确保奶油和蛋糕体在一起,而不是随机乱切。
- 工作原理: 系统获取文本行,并将它们在视觉上合理的逻辑分组为块。随后,它会对这些块进行修剪,去除属于该特定块之外的任何干扰性页面部分。
- 结果: 机器人得到了一个干净、集中的小段文本图像。这保留了局部上下文(因此它知道哪些词靠在一起),同时排除了页面其余部分的噪音。
第二步:特殊翻译官(词元增强识别)
一旦文本被切成完美的块,机器人就需要阅读它。在这里,TongGuOCR 使用了一个“特殊翻译官”,它说着两种新的语言来帮助机器人更好地理解古文。
语言 1:生僻字字典。
现代 AI 分词器(将文本分解为计算机可读片段的工具)经常将罕见的古代字符切碎成细小、令人困惑的碎片。TongGuOCR 通过赋予每个生僻字符一个**单词元(single-token)**身份来修复这个问题。- 类比: 想象你在学习一门新语言。与其每次看到一个难词都要逐个字母拼写,不如直接得到一个印有整个单词的特殊贴纸。你只需贴上贴纸,任务就完成了。这让机器人识别生僻字符的速度更快、更准确。
语言 2:“下一步去哪?”地图。
为了解决阅读顺序的困惑,系统在行之间插入了特殊的转换词元(transition tokens)。这些就像是小箭头或路标,告诉机器人下一步该看哪里。- 类比: 如果你在读一本分镜跳跃的漫画书,你需要一个指南说:“看完这个分镜后,跳到右上角。”TongGuOCR 在文本流中加入了这些数字路标(如
<right|down>或<left|up>)。这引导机器人的视线沿着正确的路径移动,防止它跳行或倒着阅读。
- 类比: 如果你在读一本分镜跳跃的漫画书,你需要一个指南说:“看完这个分镜后,跳到右上角。”TongGuOCR 在文本流中加入了这些数字路标(如
结果:古代文本领域的新纪录
团队在两个主要的中国历史文献基准测试集 MTHv2 和 M5HisDoc 上测试了 TongGuOCR。这些数据集就像是古代文本识别领域的“奥运会”,充满了复杂的布局和生僻字符。
结果令人印象深刻。TongGuOCR 不仅仅表现尚可,它还击败了现有的包括大规模通用 AI 模型在内的最佳方法以及其他专门的 OCR 工具。
- 在极具挑战性的 M5HisDoc 基准测试中,TongGuOCR 实现了 93.76% 的准确率 (AR)。
- 它将 归一化编辑距离 (NED) —— 一个衡量机器人犯错程度的指标 —— 从 10.43 降低到了 6.15。
- 最重要的是对于阅读流而言,它将 阅读顺序编辑距离 (RO-ED) 从 7.53 削减到了 3.49。这意味着机器人能够更好地遵循正确的路径,很少跳行或迷失方向。
在视觉对比中(如论文图 4 所示),当其他模型漏掉行、以错误顺序阅读或将生僻字符读错时,TongGuOCR 成功恢复了每一行目标文本,并遵循了历史页面的自然阅读顺序。
这意味着什么
论文指出,要有效地阅读古代文本,我们不能仅仅依赖更大、更强大的 AI 模型。我们需要更聪明地处理如何将数据喂给模型。通过将页面分解为逻辑块(布局感知预处理),并为模型提供更好的词汇表和清晰的阅读顺序地图(词元增强识别),我们可以解锁那些此前被锁在不可读图像背后的历史秘密。
研究人员指出,虽然他们的系统取得了巨大进步,但尚未完美。它依赖于其训练数据中出现的字符,因此面对完全未知或尚未破译的符号时可能仍会遇到困难。然而,对于绝大多数中国历史文献,TongGuOCR 提供了一把通往过去的强大新钥匙,将静态图像转化为历史学家和好奇的思想可以探索的、鲜活的可搜索文本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。