Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers
本文介绍了机构报纸流水线(Institutional Newspapers Pipeline),这是一个与波士顿公共图书馆合作开发的模块化且计算高效的系统,通过分割、光学字符识别(OCR)和高级文本分析的多步工作流,将超过 140 万份历史报纸扫描件处理成包含 163 亿个高质量标记的结构化开放数据集。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
报纸是人类生活的日常记录,捕捉了从地方选举到面粉价格,从讣告到新发明广告的一切内容。几个世纪以来,这些故事一直被保存在脆弱的纸张上,但在数字时代,图书馆已经扫描了数百万页这些页面,使其变得触手可及。然而,将报纸页面的图像转化为有用的、可搜索的文本却出人意料地困难。这些页面密集且杂乱,充满了文本列、装饰性标题以及经常相互交织的广告。标准的计算机程序在处理整洁文档时表现良好,但在面对这种混乱时往往会感到困惑,产生充满错误或缺失整个章节的文本。这为那些想要从历史中学习的研究人员和人工智能系统制造了障碍,因为它们无法轻松阅读页面上所写的内容。
哈佛法学院和波士顿公共图书馆的一个研究小组开发了一种解决此问题的新方法。他们创建了一个分步系统,旨在将单个报纸页面分解为最小的、最逻辑的组成部分,高精度地读取每个部分的文本,并组织好一切,使计算机能够理解其布局和内容。他们的目标不仅是实现文本数字化,而是创建一个干净、结构化的数据集,以揭示超过一百万份历史报纸扫描件的真实内容。通过将每个独立的文本块或图像视为一个单独的项目,他们成功地从以前难以有效使用的材料中提取了数十亿个单词。
该过程始于获取报纸页面的数字图像,并教计算机像人类读者一样看待它。系统不是尝试一次性阅读整个页面,而是首先识别每一个独特的内容块,例如单篇文章、照片或广告。研究人员通过展示数千个示例,训练了一个计算机模型来识别这些块或“裁剪块”。该模型学会了忽略边缘周围的空白区域和列之间的复杂边界,仅专注于实际内容。在测试中,这个分割工具证明了其高度的有效性,成功识别了超过 140 万张报纸页面中的 8300 多万个独立块。平均而言,每个页面都被分解成约 56 个独立的碎片,使系统能够精准地处理过去的复杂布局。
一旦页面被划分为这些易于管理的碎片,系统就会读取其中的文本。研究人员使用了两种不同的方法来进行此操作,并将它们并排运行以确保获得最佳结果。第一种方法使用了一种应用了数十年的传统工具,用于将文本图像转换为数字字母。第二种方法使用了一种更新、更先进的人工智能模型,它可以更好地理解图像的语境。这种较新的模型在阅读受损、褪色或使用令旧工具困惑的装饰性字体的文本方面表现得尤为出色。在许多情况下,先进的模型甚至可以猜测撕裂页面中的缺失字母,填补空白以创建完整的句子。通过结合两种方法的输出,团队生成了一个庞大的文本集合,总计 163 亿个 token,足以填满数千本书。
在提取文本后,系统接着致力于理解每个内容的实际属性。它将数百万个块分类,区分新闻文章、广告、照片和漫画。为了准确完成此操作,系统会同时观察该块的视觉外观和其中包含的文字。例如,一个看起来像照片但没有文本的块会被识别为图像,而一个带有标题和故事的块则被识别为新闻。研究人员发现,广告构成了这些块中数量最大的部分,但实际的新闻故事包含了大部分的单词。这种区别至关重要,因为它允许研究人员研究报纸的视觉性质如何随时间变化,注意到随着年代的演进,广告变得越来越具有视觉性,并在页面上占据了更多的空间。
系统还按照人类自然阅读的顺序组织文本。报纸通常有文章从一列开始并在另一列继续,或者被图片中断的故事。研究人员开发了一种方法来绘制这些路径,确定哪个块紧随其后,以及下一个是什么。虽然这是一项复杂的任务,但他们的方法成功重建了很大一部分页面的阅读顺序,在宏观层面达到了 72.1% 的准确率,在微观层面达到了 80.8% 的准确率,使文本能够逻辑连贯地从头到尾流动。这一步骤将零散的图像碎片转化为一个可以像现代文档一样进行搜索和分析的连贯叙事。
除了阅读和组织文本之外,系统还为每一个块添加了有用的信息层。它识别所使用的语言,发现虽然大部分收藏是英文,但也有相当一部分是意第绪语、德语、瑞典语和法语,反映了当时的多元移民社区。它还扫描文本以寻找人名、地名和组织机构名称,标记了数百万处关于波士顿和纽约等地点,或国会等机构的提及。此外,系统还为每个块分配一个主题,将其标记为商业报告、政治新闻或其他科学动态。这种丰富的标签化使得研究人员可以提出具体的问题,例如“‘波士顿’一词在广告中出现的频率与在新闻故事中相比如何?”或者“在 19 世纪 80 年代,哪些话题最为常见?”
整个操作设计得足够高效,可以在标准计算机硬件上运行,而不需要庞大且昂贵的超级计算机。研究人员分批次处理数据,优化每个步骤,以确保系统能够处理如此大量的材料而不至于崩溃或变得过慢。在租用计算能力运行该流水线的总成本估计约为 2.5 万美元,这仅为使用最先进、最昂贵模型所需成本的一小部分。这种效率意味着其他图书馆和机构也有可能使用相同的工具来解锁他们自己的历史收藏。
这项工作的成果是一个庞大的开放数据集,它不仅包含了文本,还包含了 1795 年至 1930 年间超过一百万份报纸页面的结构和语境。研究人员已向公众开放了这些工具、模型和最终数据,允许任何人以新的方式探索这段历史。虽然该系统并不完美,在处理最困难的案例时仍需要人工监督,但它代表了在使历史报纸变得触手可及方面的一次重大飞跃。通过将混乱、嘈杂的图像转化为干净、结构化的数据,该团队为人们打开了一扇通往过去日常生活的窗口,为未来的研究以及人工智能如何从人类历史中学习提供了基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。