Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics
本文介绍了 Sampled-BPE,一种轻量级的词元级审计流水线,它通过在小样本上训练 BPE 分词器,高效地识别了大规模中文语料库中的污染问题,揭示了开放数据集中广泛存在且不断变化的污染现象,并提供了一个用于进一步分析的分层数据集。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的、无尽的图书馆,其中的每一本书、每一篇博客和每一个损坏的网页都是一页文本。多年来,科学家们一直试图教会计算机阅读并理解这个图书馆,以构建“大语言模型”(LLMs)——即像你可能正在聊天的那些一样超级智能的 AI 助手。但问题在于:互联网不仅仅是一个整洁的图书馆,它也是一个充满垃圾信息、诈骗和不当内容的混乱市场。当 AI 从这个混乱的图书馆中学习时,它可能会无意中养成坏习惯,比如学会编写关于在线赌博的内容或生成奇怪的、冒犯性的短语。这被称为“语料库污染”。为了修复这个问题,研究人员需要审计这个图书馆,但由于图书馆规模过于庞大(数万亿页!),阅读每一页的时间将超过人类的一生。他们需要一种方法,能够窥视其中并找到那些“坏苹果”,而无需检查每一页。
这正是论文《通过采样 BPE Token 统计审计大规模中文语料库》(Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics)所解决的问题。作者们来自清华大学及其他机构,他们意识到尝试扫描整个中文互联网中的不良内容既缓慢又昂贵。因此,他们发明了一个聪明的捷径,叫做 SAMPLED-BPE。你可以把它想象成一位海洋生物学家,想要了解一片巨大的海洋有多么污染。她不需要舀起每一滴水,而是从不同地点采集一些小样本进行分析,并以此来估算整个海洋的污染程度。在这个案例中,“海洋”是中文互联网,“污染”是会被刻入 AI 模型中的有害或垃圾信息(token/词元)。
该团队的方法非常简单却功能强大。他们从海量的中文文本数据中取出一小块(仅为总量的 0.25% 甚至更少),仅针对这一小块数据训练一个特殊的“分词器”(一种将文本分解为称为 token 的小块的工具),然后观察哪些 token 出现的频率最高。如果一段文本在他们的样本中频繁出现,那么它很可能也是整个数据集中的常见模式。接着,他们使用一个聪明的 AI 助手,通过在网上搜索来检查这些高频片段的实际含义。如果某个片段被发现是一个赌博网站或色情短语,他们就会将其标记出来。
他们的发现令人震惊。他们审计了 11 个不同的开源中文文本集以及 2021 年至 2026 年间的 6 个中文网络快照。他们发现污染无处不在,但分布并不均匀。有些数据集相对干净,而另一些则完全淹没在不良内容中。例如,名为 OSCAR 的数据集被发现污染率超过 83%,且大部分为成人内容。另一个数据集 mC4 则充斥着大量的在线赌博术语。更有趣的是,他们发现“中文 Common Crawl”(一个巨大的、原始的网页转储数据)污染严重,且污染类型会随时间变化。在 2026 年,其快照中近 69% 的内容是成人材料,而赌博内容自 2021 年以来已显著下降。这表明,互联网上的“坏东西”是一个移动的目标;一旦某种类型的垃圾信息被屏蔽,另一种就会冒出来。
该论文还反对仅仅建立一个固定的“坏词”列表来进行过滤的观点。因为污染变化极快,且经常使用隐晦、缩写或组合词(例如将两个正常的词组合成一个赌博术语),静态列表很快就会变得毫无用处。相反,作者建议我们需要定期对网络进行审计,就像他们所做的那样。为了帮助他人进行此类工作,他们发布了一个包含超过 63 万条记录的新型大规模数据集,这些记录按“树”状结构组织,展示了短小的坏词是如何演变成更长、更复杂的坏短语的。
简而言之,这篇论文证明了你不需要读完整个海洋就能知道它是脏的;一个聪明的小样本足以让你看清全貌。他们展示了中文互联网目前是一个非常适合 AI 训练的污染之地,且污染正在迅速移动和演变。他们的新工具 SAMPLED-BPE 让检查这些庞大数据集的工作从数月缩短到数小时,为研究人员提供了一种在不被互联网庞大规模所压倒的情况下,保持 AI 模型纯净的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。