Counting Documents Is Not Counting Text: Unit Bias in Web-PDF Corpus Statistics
本文揭示了网络 PDF 语料库统计数据存在显著的“单位偏差”,即通过报告每篇文档的指标而非每单位标记(token)的指标,这掩盖了这样一个事实:极少数大型文档包含了绝大部分文本,且当前的截断策略导致超过一半的语料库总内容丢失。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在浩瀚且混乱的网络图书馆中,一种新型的书籍已成为教授人工智能如何思考的必备工具。这些并非我们用鼠标浏览的网页,而是被称为 PDF 的数字文档,它是分享报告、学术论文和官方表格的标准格式。多年来,构建这些智能系统的研究人员一直将每个数字文件视为一个单一且相等的单元。如果一个数据集包含一百万份文档,他们就假设其中包含了一百万份相等的信息量,无论其中一份文件是单页传单,还是另一份是五百页的百科全书。这种假设塑造了我们衡量用于训练世界最先进计算机模型的数据的规模和质量的方式。但仔细观察就会发现,按文件计数是统计字数的一种拙劣方式,而这两个单位之间的差异改变了我们对数据的认知。
Common Crawl 基金会的 Luca Foppiano 最近的一项研究挑战了研究人员描述这些海量文本集合的标准方式。该团队检查了 2021 年的一个特定互联网快照,这是一个包含近八百万个 Web PDF 的数据集。虽然该数据的原始创建者以文档数量来报告其规模,但 Foppiano 及其同事决定通过这些文件中实际包含的文本量来进行衡量。他们发现了一个惊人的失衡:这些文档完全不具备可互换性。极小比例的文件,特别是那些非常长的文件,包含了绝大部分的文字。事实上,仅占三 percent 以上的文档就持有全部文本的一半,而剩余的 97% 则分享了另一半。这意味着,如果你按文件数量来看,它似乎是一个由短便条和表格组成的图书馆;但如果你按字数来看,它就是一个由庞大、厚重的卷册所主导的图书馆。
这种长度上的偏差对于数据处理方式以及过程中会丢失什么产生了深远的影响。提供这些文件的互联网存档机构有一条为了节省存储空间的规则:它会截断任何大于特定大小的文件。长期以来,那个限制是 1 MB。研究表明,这条规则影响了集合中近四分之一的文档,这听起来似乎尚可接受。然而,由于被截断的是那些最长的文档,这些被截断的文件包含了近三分之二的所有文本。当研究人员试图重建这些被截断文件的缺失部分时,他们发现这种破坏往往是永久性的。通过使用两种不同的标准工具来读取这些损坏的文件,他们发现一种工具只能恢复约 11% 的缺失单词,而另一种工具仅能恢复不到 1%。对于绝大多数这些受损的文件,工具无法提取出任何文本,导致计算机模型出现了显著的知识空白。
研究人员还观察了当存储限制提高时会发生什么——这一变化发生在 2025 年,当时限制增加到了 5 MB。虽然这一调整减少了被截断文件的数量,但并未解决文本丢失的问题。即使有了更高的限制,该集合中仍有近 30% 的总单词会被截断。研究表明,仅仅提高大小限制不足以挽救最有价值的内容,因为最大的文档往往如此庞大,以至于即使是 5 MB 的切片也太小,无法捕捉到它们的开头。研究人员得出结论,我们讨论这些数据集合的方式具有误导性。仅通过文档数量报告统计数据,掩盖了少数巨型文件持有几乎所有信息的现实。为了真正理解这些人工智能系统正在学习什么,我们必须计算字数,而不只是计算文件,并意识到目前存储和过滤互联网的方法正在丢弃我们需要的大部分文本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。