💬 NLP
Infini-News: Efficiently Queryable Access to 1.3 Billion Processed Common Crawl News Articles
本文介绍了 Infini-News,这是一个综合性的工具包和索引,它利用丰富的元数据和语言检测处理了超过 13 亿篇 Common Crawl 新闻文章,使研究人员能够在亚秒级时间内高效地对整个档案库进行任意文本模式的查询。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想研究过去十年间世界是如何谈论重大事件的。你需要一个包含海量新闻文章的图书馆。
在过去,你只有两个糟糕的选择:
- 付费墙:前往商业新闻档案库(如高端图书馆)。那里应有尽有,但费用高昂,而且你甚至不允许将书籍借给朋友,或将其带出大楼。
- 原始数据转储:前往“通用爬虫”(Common Crawl),这是一个巨大的、免费的整个互联网仓库。那里应有尽有,但它是数万亿字节的原始 HTML 文件构成的混乱废墟。要找到一篇文章,你不得不自己建造推土机,在堆积如山的数字垃圾中筛选,并花费数月时间清洗数据,然后才能开始阅读。
Infini-News 是作者为解决这一问题而构建的方案。把它想象成针对全球最大免费新闻档案的超强大、预清洗且可即时搜索的索引。
以下是其工作原理的简单分解:
1. 大清洗(“预处理语料库”)
作者将原始、杂乱的仓库(180 TB 数据)通过了一台复杂的清洗机器。
- 他们做了什么:他们去除了广告、“立即订阅”弹窗、导航栏以及损坏的代码。
- 结果:他们最终获得了从 2016 年 8 月至今的13.5 亿篇干净新闻文章。这就像将一堆未分类的废金属变成了整齐有序的成品汽车仓库。你不再需要是机械师才能使用它;你只需驾驶汽车即可。
2. 智能标签(元数据丰富)
13.5 亿篇文章的堆积仍然令人望而生畏。你需要知道自己在看什么。作者为每篇文章添加了三层“智能标签”:
- 语言标签:他们不仅猜测语言,还使用了三位不同的“侦探”(AI 分类器)来标记语言。如果一位侦探不确定,其他侦探会进行复核。这涵盖了超过 1,000 种语言,从英语和西班牙语到稀有方言。
- 来源地:他们试图找出每篇文章来自哪个国家。他们利用了网站地址(例如德国的
.de)、页脚中的出版商地址以及已知新闻机构的列表等线索。他们成功地为222 个国家的 83% 的文章标记了来源。 - 为何重要:这使得研究人员能够提出诸如“关于乌克兰战争的新闻在德国与巴西有何不同?”之类的问题,而无需手动阅读每一篇文章。
3. 魔法搜索引擎(Infini-gram 索引)
这是最令人印象深刻的技巧。通常,搜索 13.5 亿篇文章需要数小时甚至数天。
- 类比:想象在一个拥有十亿本书的图书馆中寻找特定的句子。普通搜索引擎必须打开每一本书,阅读每一页,并检查单词是否匹配。这很慢。
- Infini-News 的技巧:他们构建了一个后缀数组索引。将其想象成图书馆中每一个单词和短语的魔法般超详细地图。
- 速度:有了这张地图,你可以输入一个短语(甚至是像“气候变化”或特定引语这样奇怪的内容),系统会在不到一秒的时间内找到它的每一个实例。
- 无需下载:你不需要下载整个图书馆即可进行搜索。你只需查询地图,获取一份“书籍 ID"列表,然后仅下载你需要的特定文章。这节省了研究人员对巨大硬盘的需求。
你可以用它做什么?
该论文强调了几种研究人员可以使用此工具的具体方式:
- 时间旅行:你可以追踪一个故事在 10 年间的变化(纵向分析)。
- 追踪谣言:你可以看到某条特定新闻或虚假引语是如何从一家报纸传播到另一家报纸的(内容 syndication)。
- 全球比较:你可以比较不同国家如何报道同一事件。
- AI 安全:你可以通过搜索精确匹配项,检查新的 AI 聊天机器人是否基于特定新闻故事进行了训练。
注意事项(局限性)
作者诚实地说明了该工具无法做到什么:
- 非实时:新闻来自档案,因此存在轻微延迟。你无法用它来监控此时此刻正在发生的突发新闻。
- 缺失付费墙内容:它仅包含免费新闻。如果报纸将文章置于“付费墙”之后,Infini-News 就没有收录。
- “机器人”问题:大约在 2023 年,许多新闻网站开始阻止 AI 爬虫。作者注意到此后某些网站的新文章数量有所下降,因此对于非常近期的数据,完整性可能略有不足。
- 标签并非完美:国家和语言标签非常准确(约 89% 的准确率),但并非 100% 完美。如果研究人员需要绝对精确,预计会进行双重检查。
核心结论
Infini-News 是一个“以检索为先”的工具包。它不再强迫研究人员下载一座小型城市规模的图书馆,而是提供了一把钥匙,让他们能够即时找到所需的精确页面,并仅下载这些页面。它将一座混乱、难以接近的数据大山,转变为一个干净、可搜索且免费的资源,用于研究世界如何沟通。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。