Wiki Dumps to Training Corpora: South Slavic Case
本文提出了一种语言无关的方法,通过从多个维基百科项目中系统提取文本,并采用基于 n-gram 的过滤机制以剔除低质量、重复的文章,从而将原始维基媒体数据转译为适用于七种南斯拉夫语系语言的高质量、富含语言特征的训练语料库。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想建立一个包含故事、诗歌和新闻文章的庞大图书馆,用来教机器人如何说和理解七种不同的南斯拉夫语言(如塞尔维亚语、克罗地亚语、保加利亚语等)。你决定使用维基百科及其姊妹网站(如维基文库或维基新闻)作为素材来源,因为它们免费且充满文本。
然而,如果你只是直接从这些网站抓取原始文件,你得到的并不是一个故事图书馆。你得到的是一座混乱的仓库,里面堆满了:
- 建筑废料:隐藏的计算机代码、格式指令和“蓝图”,它们告诉网站如何呈现,但不属于故事本身。
- 碎玻璃:损坏的链接和空白部分。
- 工厂制造的克隆体:成千上万篇几乎完全相同的文章,因为它们是从数据库自动生成的,而非由人类撰写。
本文是一份指南,介绍如何清理那座杂乱的仓库,将其变成一座 pristine 的图书馆。作者米哈伊洛·什科里奇(Mihailo Škorić)将整个过程分为两个主要阶段:大清理和质量过滤器。
第一阶段:大清理(文本提取)
将原始维基百科数据想象成一栋仍在施工中的房屋。到处都是脚手架、油漆罐和蓝图。你暂时还无法入住。
作者组建了一支专门的“施工队”(一个计算机程序),将房屋 stripped 到 bare、可居住的墙壁。
- 拆除脚手架:该程序使用名为
mwparserfromhell的工具(一个理解维基百科“秘密语言”的 fancy 工具),剥离所有计算机代码、模板和格式标签。 - 消除噪音:它删除“分类”列表(如文件柜上的标签),剥离图像描述,并移除那些看起来像脚注但不属于主故事的“参考文献”部分。
- 压平表格:维基百科经常使用表格来组织数据。该程序将这些复杂的网格转换为简单、可读的句子,以免机器人被网格线搞糊涂。
- 结果:经过这一阶段后,你得到了一堆干净、纯文本。它不再是网站,而只是文字。
第二阶段:质量过滤器(移除克隆体)
现在你有了干净的文本,但出现了新问题。有些文章是“僵尸”文本。这些文章看起来像是人类写的,但实际上是由计算机自动生成的。它们重复、乏味,并以略微不同的方式反复说同一件事。
如果你将这些“僵尸”文章喂给机器人,它将学会以机器人般的重复循环说话。为了解决这个问题,作者采用了一种侦探策略:
- 按街区分组:程序按主题对文章进行分组(例如,所有关于“历史”的文章放在一个房间,所有关于“体育”的放在另一个房间)。如果只比较同类项,更容易发现重复内容。
- “指纹”扫描:程序将每篇文章转化为数学“指纹”(向量)。它查看文章的前几个单词,以检查其是否匹配模板模式。
- 相似度测试:它使用一种称为MinHashing的数学技巧,将这些指纹相互比较。想象你有两本书。如果它们有太多完全相同的句子按相同顺序出现,它们很可能是克隆体。
- 截断点:程序计算“相似度分数”。如果一篇文章与其他文章过于相似(超过某个阈值),它就会被踢出图书馆。这就像俱乐部的门卫说:“你和排队里的每个人都长得一模一样;你进不去。”
结果
本文在七种南斯拉夫语言上测试了这种方法。结果非常显著:
- 塞尔维亚语:需要清理的混乱程度最大。过滤前,它有超过 50 万篇文章。经过“门卫”的工作后,近一半的文章被移除,因为它们是重复或自动生成的。词数下降了近 60%。
- 保加利亚语和斯洛文尼亚语:这些语言原本就很干净,因此损失的文章较少。
- 回报:最终结果是一个更小但质量高得多的图书馆。这些新图书馆中的词汇更符合真实人类的说话方式,而不是数据库生成文本的方式。
为什么这很重要
作者认为,为了让机器人学好一门语言,它需要阅读真实的人类写作,而不是计算机生成的填充内容。通过执行这两步过程(清理代码,然后过滤克隆体),本文提供了一套可靠、高质量的书籍,用于训练南斯拉夫语言的 AI 模型。
简而言之:本文教导我们如何将维基百科那个杂乱、充满代码的垃圾堆清理干净,清除计算机垃圾,然后扔掉“复制粘贴”的文章,留下一套纯粹的人类语言集合,供机器人学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。