Optical Character Recognition of Historical Moroccan Arabic Calligraphy Using Transformer-Based TrOCR
本文提出了一种基于 Transformer 的 TrOCR 框架,该框架通过直接识别经过预处理的历史摩洛哥阿拉伯语手稿文本行,绕过了困难的字符分割问题,从而实现了对复杂且退化的书法进行有效转录,以用于数字遗产保护。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几个世纪以来,文字一直是人类记忆的主要载体,将文明的法律、故事和科学发现跨越时空传递下来。然而,随着纸张老化和墨迹褪去,这些文献往往变得让现代人难以辨认,被锁在物理衰败和陌生的手写风格之后。在计算机科学领域,一种被称为光学字符识别(OCR)的领域,研究人员长期以来一直致力于教机器以近乎完美的准确度读取印刷文本。然而,当这些机器遇到那些凌乱、流畅且往往受损的历史手稿时,它们经常会陷入困境。对于阿拉伯书法而言,这一挑战尤为严峻,因为单个单词内的字母通常以复杂的、连写的链条形式连接在一起,且因作者的不同而千差万别。针对具有特定文化底蕴的摩洛哥阿拉伯语手稿——其使用的是一种被称为马格里布体(Maghbi script)的独特书写风格——这项任务显得格外困难,因为字母之间的接触、重叠和偏移方式会令标准的阅读软件感到困惑。
两位独立的研究人员,阿德南·梅达维(Adnane Mehdaoui)和哈迪佳·埃尔·马鲁菲(Khadija El Maaroufi),通过开发一种绕过传统“分离单个字母”需求的新方法,解决了这一问题。他们并没有试图将一个单词切割成组成部分——这一任务在墨水晕染或字母融合时往往会失败——而是训练了一个现代人工智能系统,让它将一整行文本视为一个完整的、连贯的故事。通过使用一种被称为 Transformer 的先进计算机模型(该模型旨在一次性理解整个句子的上下文),他们创建了一个能够破译这些困难历史页面的系统。他们的工作表明,通过将精细的图像清洗与一种学习文字流动感而非孤立形状的模型相结合,是有可能解锁那些此前隐藏在眼前的摩洛哥遗产秘密的。
研究人员首先从开源档案中收集了两百页代表摩洛哥特有马格里布体的页面。这些页面远非完好无损;它们遭受了古代文献常见的病症,如光照不均、墨迹褪色以及随时间推移而变形的纸张。为了使这些图像对计算机而言是可读的,团队首先构建了一个专门的处理流程来清洗和组织数据。他们调整了对比度,使深色的墨迹在陈旧的纸张上脱颖而出,然后使用智能检测系统来寻找每行文本的起始和结束位置。这一步至关重要,因为历史手写体经常会出现倾斜或偏移,使得标准工具难以判断一个句子的结束与下一个句子的开始。该系统自动分析了墨水的间距和密度,将页面切分为单独的行,从而创建了一组用于下一阶段学习的干净图像集。
一旦行被隔离出来,研究人员便转向了一个被称为 TrOCR 的强大工具,即基于 Transformer 的光学字符识别。与试图逐个识别字母的旧系统不同,该模型通过同时观察整行文本来工作。它使用一种称为“自注意力机制”的机制,允许计算机在阅读时权衡图像不同部分的重要性。例如,如果一个字母略微变形或缺失了一个点,模型可以通过观察周围的字母和单词的整体形状来推测缺失的部分很可能是什么。这种理解上下文的能力对于阿拉伯语至关重要,因为在阿拉伯语中,字母的形状取决于它是在单词的开头、中间还是结尾,而且字母上方或下方的微小点号可以完全改变其含义。
为了教这个模型阅读摩洛哥阿拉伯语,研究人员并非从零开始。他们使用了一种称为“迁移学习”的技术,采用了一个已经在数千份英文手写文档上训练过的模型,并将其适配到阿拉伯语脚本。这类似于一个已经学会弹钢琴的人可能会比完全的初学者更快地掌握一种新乐器,因为他们已经理解了节奏和旋律的基础。随后,该模型在摩洛哥数据集上进行了微调,学习识别马格里布体特有的曲线、连接和风格。团队在约八千对图像及其对应的正确文本转录上训练了该系统,同时保留了另外两千对用于测试模型在从未见过的材料上的表现。
这些训练结果是通过一个名为“字符错误率”(Character Error Rate)的标准指标来衡量的,该指标统计了计算机错误的字符数量与正确文本之间的差异。在测试集上,该模型的错误率仅略高于 5%。这意味着对于一行文本中的每一百个字符,系统能正确识别出超过 95 个。研究人员指出,模型的表现于训练、验证和测试阶段保持一致,这表明模型真正学习了脚本的模式,而不仅仅是死记硬背它所展示的特定页面。对于由于书写变化和损伤的存在而使得完美识别极具挑战性的历史文献而言,这种水平的准确度意义重大。
尽管取得了这些成功,作者们也谨慎地指出,这项工作并不能完全解决阅读古代手稿的所有问题。该系统在处理“变音符号”方面仍存在困难——即位于字母上方或下方、用于指示发音或含义的小点或线条,这些符号在古文献中往往模糊不清或缺失。如果这些标记被误读,单词的含义可能会发生彻底改变。此外,该模型是在经过精心提取的行文本上进行训练的;它目前还无法处理具有复杂布局的完整页面,例如写在边缘的注记或多栏排列的文本。研究人员还强调,标注数据的稀缺仍然是一个主要障碍,因为创建训练集需要专家进行人工转录,这是一个缓慢且困难的过程。
研究得出结论,虽然深度学习已经取得了长足进步,但它目前还无法取代人类的专业知识,也无法克服纸张老化的所有物理限制。然而,梅达维和埃尔·马鲁菲所采取的方法提供了一条稳健的前行之路。通过将智能图像预处理与理解整行上下文的模型相结合,他们创建了一个能够显著加速摩洛哥历史遗产数字化进程的工具。这项工作不仅仅是产生一串数字;它提供了一个实用的框架,让研究人员能够获取并保护那些此前难以阅读的数个世纪的语言与文化知识。随着领域的推进,集成语言模型来纠正错误以及开发更好的数据增强技术,可能会进一步完善这些系统,让马格里布的书写历史离现代世界更近一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。