MajinBook: An open catalogue of digitally mediated world literature
本文介绍了 MajinBook,这是一个开放目录,它将影子图书馆的元数据与 Goodreads 数据相链接,以构建一个包含超过 539,000 种数字化媒介英语书籍的高精度、机器可读语料库,同时解决传统语料库的偏差问题,并探讨该项目在欧盟和美国框架下开展研究的法律许可性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是《MajinBook》论文的解读,已用日常语言和类比进行翻译,以使概念清晰易懂。
宏观图景:绘制更完善的图书馆地图
想象一下,你想研究人们如何阅读,以及哪些故事对世界至关重要。为此,你需要一张庞大的图书地图。
长期以来,研究人员使用的是HathiTrust,它就像一座由大学建立的大型官方图书馆。它拥有数百万册图书,但存在两个大问题:
- 它被锁住了:许多书籍受版权保护,因此你无法阅读全文;只能通过一个安全且受限的窗口查看。
- 它很混乱:许多书籍只是从纸质原件扫描而来。计算机经常误读字母(例如将"o"误认为"0"),使得文本难以用于高级计算机分析。
这篇论文的作者希望获得一张更好的地图。他们转向了“影子图书馆”(如 Library Genesis 和 Z-Library)。可以将这些想象为巨大的地下数字集市,数百万册书籍在此自由共享。它们拥有的书籍数量远超官方图书馆,但秩序混乱。“书架”杂乱无章,标签常常错误或缺失,很难分辨哪本书是哪一本。
MajinBook 就是清理这种混乱的项目。它通过将这些杂乱的“影子图书馆”文件与来自 Goodreads(图书爱好者的社交网络)的有序数据相连接,创建了一个包含超过 539,000 本英文书籍(以及数百万本法语、德语和西班牙语书籍)的高质量、有组织的目录。
构成要素:他们是如何构建的
1. “仅限数字”规则(筛子)
影子图书馆中的书籍格式多样。有些是 PDF(纸质页面的数字扫描件),有些是 EPUB(原生数字文件,类似于干净的网页)。
作者决定丢弃所有 PDF 文件。
- 类比:想象你要研究汤的味道。PDF 就像给汤拍张照片,然后试图品尝这张照片。它模糊且不一致。而 EPUB 就像碗里的实际汤;你可以清晰地品尝到每一种食材。
- 结果:通过只保留“干净”的数字文件(EPUB),他们失去了一些非常古老的书籍(因为它们尚未数字化),但却获得了一个更干净、更易于计算机读取且语言种类出人意料的丰富的数据集。
2. “作品”与“版本”的问题
在图书世界中,“作品”(故事本身,如《奥德赛》)与“版本”(特定版本,如 1990 年的译本或 2020 年的有声书)之间存在区别。
- 问题:影子图书馆中可能有 50 个不同的《奥德赛》文件。如果你将它们全部计为 50 本不同的书,你的数据就会失真。
- 解决方案:作者利用 Goodreads 作为“骨架”或“归档系统”。Goodreads 已经知道所有 50 个版本都属于同一个“作品”。他们利用这一知识将杂乱的影子图书馆文件分组,并将它们链接到正确的故事及其原始出版日期。
3. 匹配游戏(在干草堆里找针)
如何将影子图书馆中杂乱的文件与 Goodreads 上的正确条目连接起来?
- 策略:他们没有尝试匹配确切的封面艺术或页数(这些经常变化),而是查看 标识符(如 ISBN 编号)和 标题。
- 模糊逻辑:有时影子图书馆中的标题会有轻微拼写错误(例如"Hary Pottter")。作者使用了一种称为“模糊匹配”的计算机技巧,意识到:“嘿,那很可能就是《哈利·波特》。”
- 安全检查:他们通过让人类检查 200 个随机匹配来测试这种方法。他们发现,如果计算机给出的“置信度评分”为 80 或更高,那么几乎总是正确的。他们将最终规则设定为 80 分的阈值,以确保其目录高度准确。
结果:他们发现了什么?
- 庞大且干净的合集:他们创建了一份包含 539,000 本英文书籍 的清单,这些书籍已准备好供计算机分析。
- 时间偏差(但很有用):由于他们只保留了“原生数字”文件,他们的合集中 19 世纪的书籍较少,而 21 世纪的书籍较多。
- 论文的观点:作者承认,这并不是对所有文学的完美历史记录。相反,它是 21 世纪数字文化 的完美历史记录。它向我们展示了在数字时代,哪些书籍当下最受欢迎。
- 更多语言:令人惊讶的是,通过筛选数字文件,他们实际上获得了更多样化的语言组合。“PDF"堆中主要是英文,但"EPUB"堆中包含了相当数量的法语、德语、西班牙语和其他语言。
法律“细则”
该论文解决了一个棘手的问题:使用这些影子图书馆进行研究是否合法?
- 论点:作者认为,他们并没有出售书籍或分发故事。他们仅发布了一份 事实清单(标题、作者、日期)。
- 类比:这就像图书管理员制作卡片目录。卡片目录不包含故事本身;它只是告诉你故事在哪里以及是谁写的。作者声称,出于研究目的创建这种“卡片目录”符合美国和欧盟关于“文本与数据挖掘”的法律例外规定。
总结
MajinBook 是一个工具,它利用 Goodreads 的社交智慧,将“影子图书馆”混乱、庞大且往往杂乱的领域进行整理。其结果是一份超级干净、计算机友好的图书清单,有助于研究人员在数字时代研究文化、文学和阅读习惯,同时 navigating 复杂的版权法律格局。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。