← 最新论文
💻 computer science

Institutional Books - Visual Elements: An open-source pipeline for extracting, classifying, deduplicating, and captioning visual elements from digital book collections

本文介绍了一个开源流水线以及一个包含从近百万册历史书籍中提取的 2260 万个视觉元素的全新数据集,旨在实现对非文本内容的自动检测、分类、去重和说明,从而为数字化图书馆藏品中的新研究和人工智能训练提供机遇。

原作者: Jimmy Mendez, Matteo Cargnelutti, David Lowry-Duda, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jimmy Mendez, Matteo Cargnelutti, David Lowry-Duda, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

图书馆是人类历史的宏大宝库,但几十年来,其书籍的数字化版本只讲述了一半的故事。当机构扫描旧卷以使其具备可搜索性时,传统上一直侧重于文本,利用软件读取文字并将其转化为数据。这一被称为光学字符识别(OCR)的过程是一项胜利,它允许研究人员在数秒内检索数百万页的内容。然而,书中的图像——插图、照片、版画和装饰性边框——在很大程度上对机器而言仍然是不可见的。这些视觉元素承载着文本本身无法捕捉的独特语境和细微差别,但由于它们并非以计算机易于理解的结构化方式组织,因此难以进行大规模研究。随着人工智能系统变得越来越能够“观察”和理解世界,一个显著的差距出现了:这些系统主要是在互联网上的现代图像上进行训练的,往往难以理解历史性的视觉文化。为了弥补这一差距,研究人员需要一个大规模、多样化的历史图像集合,并且该集合应当是经过组织且准备好让机器学习的。

哈佛大学的一个研究小组通过构建一种全新的、开源的系统解决了这一挑战,该系统旨在发现、分类并描述近百万本数字化书籍中的视觉元素。他们的工作详述于一份技术报告中,创建了一个流水线,其作用就像一位高水平的图书管理员,能够扫描书籍、识别出每一张图片、弄清其内容并为其撰写一段简短的描述,且全程无需人工干预。其结果是一个包含从 983,004 本卷册中提取出的超过 2,200 万个视觉元素的数据库。该集合涵盖了从科学图表、乐谱到肖像和装饰艺术的一切内容,每项元素都带有关于其类型的标签,并在许多情况下附带了计算机生成的说明文字。通过公开这些数据,该团队希望帮助人工智能模型更好地理解历史材料,从而创造一个循环:更好的工具带来更多的数据,进而催生出更优秀的工具来探索我们共同的过去。

整个过程始于最基础的任务:寻找图片。研究人员开发了一个系统,用于扫描书籍的数字页面,以定位任何包含图像的区域。由于该集合规模巨大,包含数亿页内容,系统必须具备极高的效率。他们训练了一个专门的计算机模型来识别视觉元素,方法是向其展示数千个带有或不带图片的页面示例。该模型学会了忽略文本而专注于视觉部分,在每一个发现的插图、照片或图表周围画出一个框。在最终运行中,该系统处理了整个集合,并识别出超过 2,800 万个潜在图像。为了确保高质量,研究人员应用了严格的过滤器来剔除误报,例如污渍或扫描错误,最终留下了 2,260 万个独特的视觉元素。

一旦找到了图像,下一步就是理解它们是什么。该系统将 2,260 万张图像分为五个主要类别:通用插图与照片、乐谱、装饰性元素(如藏书票)、图表与图形,以及扫描伪影(如意外出现在扫描件中的手指或回形针)。研究人员训练了另一个模型来进行这些区分,教它辨别音乐符号与文本页的区别,或者辨别装饰性边框与科学图表之间的差异。该系统表现出了极高的准确性,能够正确识别绝大多数图像。例如,它能以近乎完美的置信度识别乐谱,尽管它发现某些类别(如装饰性边框)在与其他类型的插图区分时略显困难。这种分类过程至关重要,因为它允许研究人员提出具体问题,例如“给我看 18 世纪的所有图表”或“寻找每一处特定的藏书票”。

在对图像进行分类之后,团队处理了重复项的问题。在大型数字化项目中,同一图像经常多次出现,要么是因为它被用于多版本书籍,要么是因为扫描过程意外捕获了相同的页面两次。为了清理这些内容,研究人员使用了两种不同的方法来查找匹配图像。第一种方法比较图像的像素模式以找到完全相同的副本;第二种方法则观察图像的深层含义,以找到可能因扫描差异而略有不同的近乎重复的图像。通过结合这两种方法,他们识别并归类了数百万个重复图像,确保最终的数据集代表的是独特的视觉内容,而非仅仅是每个图像出现次数的列表。这一步骤将总项数减少了约 20%,留下了一个更干净、更有价值的收藏。

该项目最具有实验性质的部分涉及教导系统为图像编写描述。利用大型语言模型,研究人员要求计算机为每张图像生成一段简短的说明文字,解释其展示的内容。为了帮助计算机理解语境,他们将页面中的上下文文本与图像本身一起输入给它。系统被指示要保持精确并避免猜测,仅描述清晰可见的内容。虽然研究人员指出这些说明文字属于实验性质,应谨慎使用,但他们成功生成了近 1,800 万条描述。这些尽可能使用书籍原语言编写的说明文字提供了一种新的视觉内容搜索方式,允许用户根据图像的内容而非仅仅根据文件名或类别来查找图像。

研究人员还密切关注这项大规模工作的实际操作层面,确保过程高效且可由其他机构重复执行。他们发现,最大的瓶颈不在于计算机的思考能力,而在于加载和准备图像进行处理所需的时间。通过优化工作流程,他们利用标准计算资源在短短几周内便完成了整个集合的处理。团队将整个流水线、训练的模型以及产生的数据集作为开源工具发布,邀请其他图书馆和研究人员使用并改进他们的工作。他们还包含了关于数据局限性的明确警告,指出某些图像包含反映其创作时代背景的历史偏见或有害语言,且计算机生成的说明文字并不完美。

该项目代表了在使人类文化的视觉历史对人类和机器都变得可及方面迈出的重要一步。通过将一个庞大的、非结构化的书籍图像集合转化为可搜索、可分类且有描述的数据集,研究人员为研究过去提供了新的基础。该数据集包含超过 2,200 万个视觉元素,为训练人工智能理解历史语境以及实现新形式的数字人文研究提供了丰富的资源。这项工作表明,通过周密的规划和正确的工具,隐藏在数百万本旧书中的视觉瑰宝可以被带入光亮之下,从而为它们所讲述的故事提供全新的洞察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →