BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval
本文介绍了BullingerDB,这是一个包含海因里希·布林格书信中近21,000页历史文献的大规模多语言数据集,并评估了其在手写文本识别和时序感知作者检索方面的效用,同时强调了模型性能以及长期风格变化所带来的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,有一座巨大的、布满灰尘的图书馆,里面收藏着超过 20,000 封来自 16 世纪的手写信件。这些并非普通的信件,而是瑞士著名宗教领袖海因里希·布灵格(Heinrich Bullinger)与他人在 50 年间交换的通信。
这篇名为"BullingerDB"的论文作者们,将这一历史宝藏变成了一个巨大的计算机训练健身房。他们的目标是教会机器两项特定技能:阅读这些杂乱无章的古老信件,并识别出作者是谁,即使作者的书写风格随时间发生了变化。
以下是他们所做工作的分解,并借助一些日常类比来说明:
1. 数据集:一本“穿越时空”的相册
将 BullingerDB 想象成一本巨大的、整理有序的笔迹相册。
- 体量:它包含来自 796 位不同作者的近 50 万行文本。
- 多样性:作者们使用了不同的语言(主要是拉丁语和早期德语),并且会在句子中间切换语言,就像有人用英语和西班牙语混合发短信一样。
- 挑战:笔迹千差万别。有些人写得工整,有些人则潦草难辨。有些信件是作者年轻时写的,有些则是年老时写的。这就像试图辨认朋友在 10 岁时写的便条和 60 岁时写的便条之间的笔迹差异。
2. 第一项任务:教计算机阅读(手写文本识别,HTR)
第一项工作是让计算机阅读这些信件并正确将其打字输出。这就像雇佣一位非常快速但极度疲惫的打字员,去转录一堆手写笔记。
- 问题:笔记年代久远,墨水褪色,且文字使用的是几个世纪以来已发生变化的语言。
- 解决方案:他们测试了四位不同的"AI 学生”(计算机模型),看看哪一位阅读能力最强。
- 结果:表现最好的学生,即名为TrOCR的模型,成功以约 9% 的错误率读取了文本。
- 局限性:计算机在处理非常短的行文(如信件背面的地址)时最为吃力,因为它缺乏足够的上下文来猜测单词。这就像试图仅凭一个字母来猜单词,远比根据整句话来猜要困难得多。
3. 第二项任务:寻找作者(作者检索)
第二项工作是查看一页手稿并问:“这是谁写的?”计算机必须在 796 位作者的图书馆中进行搜索,并选出正确的那一位。
- 转折:作者们添加了一条特殊规则。既然他们确切知道每封信的写作时间,他们希望计算机不仅能找到正确的人,还要在正确的时间点找到正确的人。
- 类比:想象你在寻找朋友的照片。如果你让计算机查找“约翰”,它不应在你寻找成年照片时只展示约翰的婴儿照。它需要理解约翰的脸(或笔迹)会随着年龄增长而变化。
- 新指标:为了衡量这一点,他们发明了一个名为时间感知 nDCG(temporal nDCG)的新评分标准。你可以将其视为一个“穿越时空评分”。如果计算机找到了正确的作者,并且它推荐的其他作者也来自同一时期,它就会获得奖励。
- 结果:计算机在找到正确的人方面表现得相当不错(平均准确率约为 78%)。然而,它在排名方面并不完美。由于人们的笔迹在几十年间变化巨大,计算机有时会混淆它正在查看的是作者的哪一个版本。
4. 为何这很重要
在这篇论文之前,研究人员没有足够大的“健身房”来训练计算机处理随时间变化的历史手稿。
- 差距:之前的数据集要么太小,要么缺乏关于谁在何时书写的足够信息。
- 贡献:BullingerDB 现在是同类中最大的公开数据集。它允许研究人员测试他们的 AI 是否能应对历史的混乱现实,即人们会切换语言、随着年龄增长改变书写风格,并使用不同的字体书写。
总结
简而言之,作者们建立了一个庞大的、带有时间戳的 16 世纪信件库,以教导计算机如何阅读古老手迹并识别作者。他们发现,虽然计算机在读取文本方面已相当出色,但当作者的风格历经多年演变时,它们仍会感到有些吃力。此外,他们还引入了一种新的评分方式,奖励计算机理解文件的时间线,而不仅仅是识别名字。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。