💬 NLP
GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training
本文介绍了 GPT-NL Public Corpus,这是一个在 Hugging Face Hub 上公开、采用 CC-BY 许可的最大规模荷兰语语料库,包含 360 亿个独特的荷兰语令牌以及经过筛选的英语、代码和德语/丹麦语数据,旨在支持构建合法、有用且无害的大语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 GPT-NL Public Corpus 的项目。简单来说,这是一个专门为训练人工智能(AI)而精心准备的“荷兰语语料库”,而且它最大的特点是:完全合法、免费开放、且以荷兰语为核心。
为了让你更容易理解,我们可以把这个项目想象成为一家新开的“荷兰语 AI 餐厅”准备食材。
1. 为什么要做这个?(背景与痛点)
想象一下,你想开一家专门做荷兰美食的餐厅(训练一个懂荷兰语的 AI)。
- 现状: 目前市面上有很多“国际大杂烩”餐厅(多语言大模型),它们什么菜都做,但荷兰菜只是其中一小道,味道不够正宗。
- 问题: 想要找到足够多、足够好的荷兰语“食材”(文本数据)非常难。网上的数据虽然多,但很多都没有版权许可(就像去别人家偷菜),或者数据里夹杂着很多垃圾、偏见和有害内容(就像食材里混进了烂叶子和毒药)。
- 目标: 作者们(来自 TNO 等机构)决定自己种菜、买菜,建立一个干净、合法、全是荷兰语的“超级菜篮子”,让任何人都能用来训练出真正懂荷兰语、且能商用的 AI。
2. 这个“菜篮子”里有什么?(数据构成)
这个语料库非常巨大,就像是一个装满食材的巨型仓库:
- 核心食材(荷兰语): 有 360 亿 个荷兰语单词(Token)。这是以前任何公开模型都没用过的“独家秘方”。
- 来源: 包括政府公开文件、法院判决书、古老图书馆的数字化书籍、甚至是用 AI 把维基百科的结构化数据“翻译”成通顺的荷兰语句子。
- 配菜(其他语言): 为了帮 AI 更好地理解逻辑和代码,他们还加入了一些英语(2070 亿词)、代码(2320 亿词)以及德语/丹麦语(480 亿词)的数据。
- 比喻: 就像做荷兰菜时,偶尔加点法国的香料或德国的香肠,能让厨师(AI)的刀工和火候掌握得更好。
3. 他们是怎么挑选食材的?(三大原则)
这是这篇论文最核心的部分。他们不是随便从网上抓取数据,而是像米其林三星主厨一样,对每一块食材都进行了严格的“安检”:
A. 有用性原则 (The Usefulness)
- 比喻: 我们不需要把网上所有的“垃圾邮件”或“毫无意义的废话”都塞进菜篮子。
- 做法: 他们专注于那些能真正教 AI 理解荷兰语、英语,以及逻辑推理(代码)的数据。甚至特意加入了一些德语和丹麦语,因为它们在语法上和荷兰语很像,能帮 AI“举一反三”。
B. 法律原则 (The Law) —— 最重要的一点!
- 比喻: 想象你在超市买菜,必须确保标签上写着“允许商用”。
- 做法:
- 拒绝“禁止商用”的菜: 如果数据写着“仅供个人学习,不可商用”(Non-Commercial),直接扔掉。
- 拒绝“必须开源”的菜: 如果数据写着“如果你用了我的菜,你的菜也必须免费公开”(Share-Alike),也扔掉。因为商业公司不想被迫公开自己的 AI 模型。
- 只收“自由菜”: 他们只收集那些明确标注为 CC-BY(署名即可)或 CC-0(完全公有领域)的数据。
- 特别处理: 像维基百科(Wikipedia)虽然很好,但因为它的版权要求太严(Share-Alike),所以没有被包含在这个特定的公开语料库中。
C. 安全与偏见原则 (Harm and Bias)
- 比喻: 就像做婴儿食品,必须剔除所有有毒、发霉或带有歧视性的成分。
- 做法: 他们剔除了像 Reddit 论坛上常见的充满仇恨言论、过时偏见或极端观点的数据。虽然这些数据信息量大,但容易让 AI 学会“说脏话”或“歧视人”。他们更倾向于使用经过审核的政府文件、学术文章和经过人工整理的档案。
4. 他们是怎么“种菜”的?(数据创建)
除了从网上“买菜”,他们还自己“种菜”:
- 数字化老古董: 他们和荷兰的档案馆合作,把几百年前的手写信件、旧报纸用高科技(OCR/HTR)扫描并转换成数字文本。这些是真正的“历史老味道”。
- 合成数据(Type 1): 他们利用合法的数据库(如 Wikidata),通过程序把枯燥的“事实条目”(比如:威廉 - 亚历山大 - 头衔 - 奥兰治亲王)自动改写成通顺的荷兰语句子。这就像把“食材清单”变成了“美味食谱”。
- 注意: 他们没有直接用 AI 瞎编故事(Type 2),因为那样容易产生幻觉(胡编乱造),他们只使用有真实来源依据的“合成数据”。
5. 最后的“试吃”环节(评估与风险)
在把食材装进大篮子之前,还有一道试吃工序:
- 人工抽检: 团队会随机抽取样本,人工检查里面有没有漏网之鱼(比如个人隐私信息、脏话)。
- 风险评估: 他们会给每个数据集打分。如果某个数据集风险较高(比如包含一些历史档案,虽然有价值但可能带有旧时代的偏见),他们会减少这个数据在训练中的权重(少放点),而不是直接扔掉,以此在“保留历史价值”和“防止 AI 学坏”之间取得平衡。
总结
GPT-NL Public Corpus 就像是给荷兰语 AI 界送的一份**“法律安全、营养均衡、来源清晰”的超级大礼包**。
- 对谁有用? 任何想训练荷兰语 AI 的研究者、公司或开发者。
- 核心亮点: 它解决了“想用数据但怕侵权”的痛点,让荷兰语 AI 的发展不再依赖那些“灰色地带”的数据,而是建立在坚实、合法、透明的基础之上。
这就好比以前大家做荷兰菜只能去“黑市”偷食材,现在政府和大家一起建了一个正规、透明、免费的超级农贸市场,让每个人都能放心地做出美味的荷兰语 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。