TRIDIS: A Comprehensive Medieval and Early Modern Corpus for Handwritten Text Recognition and Named Entity Recognition
本文介绍了 TRIDIS,这是一个开放且统一的中世纪及近代早期手写文档语料库,旨在支持手写文本识别与命名实体识别,同时提出了一种创新的基于离群值的评估策略,以解决传统随机划分在遗产文献基准测试中的局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、布满灰尘的图书馆,里面装满了成千上万封中世纪和文艺复兴时期的手写信件、法律合同和皇家法令。这些文件用不同的语言(如拉丁语、法语和德语)编写,由不同的抄写员以截然不同的书写风格完成,有些甚至还有污渍或破损。
TRIDIS 是一个全新的、组织极其严密的数字化文献集的名字。你可以把它想象成一个“通用翻译机训练场”,旨在教计算机如何准确地阅读这些古老且凌乱的手写笔记。
以下是该论文内容的详细拆解,使用了简单的类比:
1. 问题所在:“太简单”的测试
长期以来,研究人员在尝试教计算机阅读古老手写体时一直面临一个问题:他们会在大量文档上训练计算机,然后从其他文档中随机抽取一部分进行测试。
类比: 想象一名学生正在为数学考试做准备。他在第一章的简单题目上进行练习。当老师从第一章中随机抽取一道测试题时,学生拿到了 A。但在现实生活中,考试可能会出一道来自第五章的难题,而这道题与他练习的内容完全不同。这种随机测试给了他一种虚假的安全感。
在古文献领域,这意味着计算机看起来比实际更聪明,因为它们只是记住了训练过程中看到的特定书写风格,而不是学会了如何处理任何风格。
2. 解决方案:“离群值”挑战
作者 Sergio Torres Aguilar 创建了 TRIDIS 来解决这个问题。但真正的创新不仅仅在于这个文献集本身,而是在于他们测试计算机的方式。
他们没有随机挑选测试题目,而是使用了一种称为**“基于离群值的划分”(Outlier-Based Splitting)**的策略。
类比: 想象你在训练一只搜回球的狗。
- 随机测试: 你在后院扔出一个球。狗接住了它。
- 离群值测试: 你扔出一个飞盘、一根木棍、一个会响的玩具和一个沾满泥巴的石头。你还在雨中、黑暗中以及从奇怪的角度投掷它们。
“离群值”策略会观察所有的手写行,并找出那些最奇怪、最破损或最不寻常的行。这些行可能具有以下特征:
- 非常奇特的书写风格。
- 几乎看不清的文字(墨迹褪色)。
- 极长或布局奇特的行。
- 非常罕见的名称或单词。
这些“奇怪”的行会被单独留出来作为测试集。计算机是在“正常”的内容上进行训练,但最终的评分是看它处理这些“奇怪”内容的能力。这提供了一个更诚实的得分,反映了计算机真正的智能水平。
3. 盒子里装了什么?(语料库)
TRIDIS 是一个巨大的工具箱,包含近 200,000 行来自各种历史收藏的文本。
- 时空穿越: 它涵盖了从 1100 年代到 1700 年代的文献。
- 语言: 它包括拉丁语、古法语、中高地德语和西班牙语。
- 风格: 它拥有不同类型的书写风格,从整齐的方块字到凌乱的草书。
- 清理: 文本经过了人工编辑的“清理”。编辑人员展开了缩写(例如将 "dms" 还原为 "dominus")并修正了标点符号,以便计算机能更好地理解其含义。
4. 结果: “好”与“卓越”之间的差距
作者使用这种新方法测试了两个流行的计算机模型(TrOCR 和 MiniCPM)。
- 随机测试: 在进行随机行测试时,计算机表现得相当不错(错误率约为 9%)。这就像学生在简单的第一章测试中拿到了 A。
- 离群值测试: 当在“奇怪”的行上进行测试时,错误率显著上升(达到 12-13%)。
核心结论: 这个差距证明了目前的计算机并不像我们想象的那样强大。当遇到历史文献中那些杂乱、不可预测的现实情况时,它们会感到吃力。通过使用这种“离群值”测试,研究人员现在可以清楚地看到计算机在哪里失败,并知道它们下一步需要学习什么。
总结
TRIDIS 是一个巨大的、开放的古手写文献库,旨在帮助计算机学习历史。它最重要的特征是一种全新的测试方法:与其给计算机进行一场简单的随机测验,不如将最难、最不寻常的例子抛给它们。这确保了当我们说一台计算机能够阅读古老手稿时,它实际上能够应对真实、混乱的历史世界,而不仅仅是处理那些完美的范例。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。