Institutional Books - Enriched Text: A customizable multilingual open-source pipeline for denoising, deduplicating, and annotating OCR text at scale
本文介绍了“富文本”(Enriched Text),这是一个可定制的开源多语言流水线,它通过对 OCR 文本进行语言检测、去重聚类和质量评分进行标注,而非应用激进的全局预处理,从而在保留元数据的同时,实现了对包含 983,004 册卷册的哈佛大学图书馆机构图书集的受控过滤。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座拥有近百万册藏书、涵盖数世纪人类思想并包含数百种不同语言的图书馆。几十年来,这些卷册一直通过机器进行扫描,将纸质页面转化为数字文本。但这些数字文本往往是混乱的。它们包含了扫描过程产生的噪声:每页底部重复出现的页码、横跨顶部的页眉,以及在行末被生硬切断的单词。对于试图从中学习的计算机而言,这种噪声是一个主要的障碍。标准的清洗数据方法通常涉及丢弃大量信息,例如删除所有非英语文本,或删除任何看起来与另一段内容相似的段落。虽然这让数据变得更“干净”,但也剥离了使之成为书籍的丰富的多语言历史和结构语境。
哈佛法学院的一个研究小组采取了不同的方法。他们没有丢弃那些混乱的部分,而是构建了一个能够仔细组织它们的系统。他们将研究成果称为“富集文本”(Enriched Text)。该流程并非生成单一、简化的词流,而是保持原始文本完整,并添加一层数字注释。这就像是为每一个段落添加了一组隐形的标签,告诉计算机这个段落是什么、它属于哪种语言,以及它是否是某个内容的副本。这使得任何使用该数据的人都可以自行决定保留什么或忽略什么,而不是由僵化的过滤器替他们做出决定。
该项目始于哈佛图书馆一个规模巨大的收藏,最初通过与谷歌的合作进行数字化,共计 983,004 册卷册。该收藏包含大约 2420 亿个文本单位(即 token),涵盖约 250 种语言。研究人员希望在不破坏源材料完整性的前提下,使这一收藏能够被现代人工智能所利用。他们面临着一种张力:计算机科学中准备数据的标准做法通常会激进地过滤掉非英语文本,并删除任何看起来像副本的内容以节省空间。然而,对于一座历史图书馆而言,删除非英语文本意味着失去一半的藏书,而删除重复项则意味着破坏长篇著作的连续性。
为了解决这个问题,团队创建了一个像细心的图书管理员一样的处理流程。首先,他们通过修复扫描过程中引入的常见错误来清理文本。他们移除了出现在页面顶部和底部的页码及页眉,这些内容经常混入句子的中间。他们修复了通过连字符在行间断开的单词,并将其正确重新组合。他们还将“末项内容”(即书的前言、后记、目录、索引等部分)从中间的主体故事或论证中分离出来。至关重要的一点是,他们并没有删除这些部分,而是对它们进行了标记,以便用户可以选择只阅读正文,或者单独研究索引。
随后,该系统将书籍分解为更小的、有意义的单元。它识别单个句子,并根据讨论的主题而非仅仅根据分页位置将它们分组为段落。这非常重要,因为一个页面可能包含两个不同的主题,或者一个主题可能跨越许多页面。通过按主题对文本进行分组,研究人员使计算机更容易理解思想的流动。他们还识别出了出现在多本书籍中的段落。他们没有删除这些重复项,而是对其进行了标记:其中一个版本的段落被标为“代表性”副本,而其他的则被标记为重复项。这保留了思想如何在不同书籍和语言之间被重复使用和传播的历史。
其中一个最复杂的步骤涉及衡量文本质量。研究人员使用了一个小型计算机模型来阅读每一个段落,并根据语言的可预测性和流畅度为其评分。这个被称为“每字节比特数”(bits-per-byte)的分数有助于识别哪些段落可能是高质量的散文,哪些段落仅仅是由于糟糕扫描导致的乱码(例如将表格误读为单一文本块的情况)。这使得用户可以过滤掉质量最差的文本,而无需自行运行昂贵的计算。
最终的结果是一个包含 2170 亿个 token、组织在 13 亿多个带注释段落中的数据集。研究人员发现,这种方法在成功清洗文本的同时,也保留了其复杂性。例如,他们发现虽然英语文本在收藏中占比最大,但系统正确识别出许多非英语书籍包含大量的拉丁语或希腊语,这些语言常用于引用或学术参考。他们还发现,随着时间的推移,文本对现代计算机变得更加可预测——即 19 和 20 世纪的书籍听起来比 17 世纪的书籍更接近我们今天使用的语言。
该团队将整个流程作为开源软件发布,这意味着任何人都可以使用它来处理自己的藏书。他们还提供了一个小工具来帮助用户解析数据,允许用户在想要简单的词表时剥离注释,或者在想要研究书籍结构时保留注释。通过选择“注释”而非“删除”,研究人员创造了一种既对机器更清晰、又对人类研究更丰富的资源。他们证明了,在利用现代技术使历史数据变得易于获取的同时,不必牺牲那些使历史具有价值的细微差别和多样性。这项工作表明,数据处理的未来不在于丢弃混乱的部分,而在于学习如何组织它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。