← 最新论文
🤖 machine learning

Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts

本文首次提出了针对古尼泊尔语手稿的端到端手写文本识别流程,通过系统探索编码器 - 解码器架构和数据为中心的技术实现了4.9%的字符错误率,同时发布代码和配置以支持低资源历史文字研究。

原作者: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Anjali Sarawgi, Esteban Garces Arias, Christof Zotter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座图书馆,里面藏满了古老而脆弱的书籍,它们用一种几个世纪以来从未以原貌被说过的语言写成。墨迹已褪,纸张皱褶,笔迹如同指纹般独一无二——没有两位抄写员的书写方式相同。试图让计算机阅读这些书籍,就像要求一个机器人去破译由一千位不同艺术家创作的秘密代码,而他们使用的文字看起来就像一团纠缠的藤蔓符号。

本文讲述了一个研究团队如何构建一位“超级读者”来数字化古尼泊尔语手稿的故事。以下是他们做法的简明解释:

挑战:大海捞针

研究人员希望教会计算机阅读古尼泊尔语,这是一种使用天城体(Devanagari)脚本书写的语言(与用于现代印地语和尼泊尔语的脚本相同,但带有一些古老特色)。

  • 问题所在:可供计算机学习的此类古老手写笔记样本极少。这就像试图教人识别某种特定鸟类,而你手中只有三张模糊的照片。
  • 混乱状况:文档杂乱无章。墨迹晕染,纸张变形,书写者未在词与词之间使用空格。他们还使用了一些看似点或线的奇特符号,其含义取决于它们所在的位置。

解决方案:三步训练营

由于没有足够的“真实”古书供计算机直接学习,他们创建了一个三阶段训练流程。这就像一名学生从幼儿园读到大学,然后才开始攻读博士学位。

  1. 第一阶段:合成游乐场(幼儿园)
    由于缺乏足够的真实古书,计算机尚无法从中学习。因此,团队利用计算机生成的文本构建了一个庞大的“虚拟”图书馆。他们选取现代尼泊尔语教科书,用 11 种不同字体打印,然后故意将其“破坏”。他们添加了数字噪声、模糊了线条,并扭曲了页面,使其看起来像是在尘封的阁楼里存放了 200 年。这为计算机提供了 10 万个练习样本,使其学习字母的基本形状。

  2. 第二阶段:印刷桥梁(高中)
    接下来,他们转向真实但印刷的天城体文本。这就像从电子游戏过渡到真实课堂。文本依然清晰整洁,但数据来自大学档案的真实资料。这一步帮助计算机在“虚假”的混乱图像与现实世界之间架起桥梁。

  3. 第三阶段:最终考试(大学)
    最后,他们将真正的宝藏喂给计算机:来自 155 份古老手稿的3,100 行真实手写古尼泊尔语文本。由于计算机在前两个阶段已得到充分训练,它现在可以专注于古老笔迹的特定怪癖、墨迹晕染以及抄写员的独特风格。

秘诀:清洗与拉伸

研究人员意识到,数据的质量比计算机大脑的复杂性更为重要。

  • 清洗标签:他们发现,描述手写内容“应该”是什么的数字注释存在微小错误(例如用两种不同的代码表示同一个点符号)。他们“清洗”了这些注释,以免计算机被自己的老师搞糊涂。
  • 数据增强(健身房):为了让计算机更强大,他们对现有图像进行了数字“拉伸”、“扭曲”和“晕染”。这就像举重运动员在杠铃上增加额外重量。通过让计算机在数千个同一页面的略微不同版本上进行练习,它学会了即使在文本变形时也能识别文字。

结果:近乎完美的阅读者

团队将他们的系统与其他工具(如谷歌的标准 OCR 和他们自己模型的简化版)进行了测试。

  • 得分:他们表现最佳的模型仅在**4.9%**的字符上出错。这意味着,如果你给它一页包含 1,000 个字母的文本,它能正确识别约 951 个。
  • 对比:标准工具惨败,经常遗漏该脚本中常见的复杂连接字母(连字)。他们的定制模型表现显著更优。

计算机出错的地方

即使有 95% 的成功率,计算机也并非完美。研究人员分析了错误,发现它们并非随机。

  • 视觉双胞胎:计算机经常混淆在手写中看起来非常相似的字母(例如字母"y"和"p")。这就像人类混淆手写的"b"和"d"。
  • 长句困境:计算机在短句和中句上表现优异,但在非常长的行(超过 120 个字符)上开始踉跄。似乎当文本过长时,计算机会“疲劳”或迷失位置,这可能是因为在训练期间它没有看到足够多的长样本。

结语

研究人员构建了一个网络应用程序,你可以上传古老手稿的照片,它会自动找到文本行并将其为你打字输出。

核心教训:在阅读古老且杂乱的手写文字的世界里,数据为王。你并不一定需要更大、更复杂的计算机大脑;你需要更好的训练数据、更清晰的标签,以及大量针对“杂乱”样本的练习。通过精心策划训练过程,他们将一种资源匮乏、难以处理的语言转化为计算机能够高精度阅读的内容,从而有助于为未来保存尼泊尔的书面历史。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →