EuroBERT: Scaling Multilingual Encoders for European Languages
本文介绍了 EuroBERT,这是一个涵盖欧洲及全球语言的多语言编码器系列,它利用最新的生成式模型创新,在多种任务中超越了现有的替代方案,同时原生支持长达 8,192 个标记的序列。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个庞大的图书馆,里面收藏着用数十种欧洲语言编写的书籍,此外还有一些代码和数学教科书。长期以来,那些能够阅读并理解所有这些书籍的“图书管理员”(AI 模型)一直显得有些过时。与此同时,新一代的“讲故事的人”(生成式 AI)却一直备受关注,因为他们可以从头开始创作新的故事。
这篇论文的作者提出了一个简单的问题:“我们为什么要忽视这些图书管理员?难道我们不能让他们的智力赶上那些讲故事的人吗?”
他们构建了一个名为 EuroBERT 的新一代图书管理员家族。以下是他们实现这一目标的简要过程:
1. 新型图书管理员的工具箱(架构)
旧的图书管理员使用一种标准但略显笨拙的方式来组织信息。EuroBERT 使用了从最先进的“讲故事者”那里借鉴而来的全新工具箱。
- 类比: 把旧的图书管理员想象成一个拿着放大镜逐行阅读书籍的人。EuroBERT 则像是一个能够瞬间扫描整页、瞬间理解上下文,并在不产生混乱的情况下记住所有位置信息的图书管理员。他们移除了不必要的“杂质”(偏差),并添加了超快速的记忆工具(如旋转位置嵌入/Rotary Position Embeddings),以处理非常长的文档而不会迷失方向。
2. 训练食谱(数据)
要让这些图书管理员变得聪明,你必须给他们喂食正确的食物。
- 盛宴: 他们用高达 5 万亿个词汇(token)的海量数据来训练 EuroBERT。这不仅仅是随机的网络闲聊,而是一个精心策划的混合体,包括:
- 15 种语言: 包括主要的欧洲语言(如法语、德语、西班牙语)以及广泛使用的全球语言(如中文、阿拉伯语、印地语)。
- 专业学科: 他们不仅喂给他们故事,还喂给了他们代码(编程语言)和数学。
- 结果: 正如一个学习了历史、数学和编程的学生会成为更好的问题解决者一样,EuroBERT 也变得更擅长在所有这些不同主题之间寻找信息。
3. 两阶段训练法(配方)
他们并没有一次性把所有的书都倒给图书管理员。他们使用了两步烹饪法:
- 第一阶段:预训练(草稿阶段): 他们向模型输入了大量多样化的数据,以学习语言、代码和数学的基础知识。在这个阶段,他们玩了一个游戏:隐藏 50% 的单词并要求模型猜出它们。这迫使模型真正去关注上下文。
- 第二阶段:退火处理(润色阶段): 这是“最后的点睛之笔”。他们对模型进行了第二次、更具针对性的饮食调整。他们调整了混合比例,加入了更多高质量的教育材料和平行翻译文本(两种语言并排呈现的句子)。至关重要的是,他们改变了游戏规则:不再隐藏 50% 的单词,而是只隐藏 10%。这有助于模型更好地理解完整的句子,而不仅仅是猜测缺失的单词。
4. 结果:他们有多强?
作者通过一系列“考试”,将 EuroBERT 与其他著名的图书管理员(如 XLM-RoBERTa 和 mGTE)进行了对比测试:
- 搜索测试(检索): 如果你问:“请帮我找一篇关于可再生能源的法语文档”,EuroBERT 能够极其快速且准确地找到正确页面。
- 理解测试(分类): 如果你展示一个句子并问:“这是积极的还是消极的?”或者“这两句话的意思是否相同?”,它比竞争对手更能准确回答。
- 利基测试(代码与数学): 这是 EuroBERT 最闪耀的地方。由于他们喂给了它数学和代码,它在理解编程语言和数学公式方面明显优于其他同等规模的模型。
- 长文档测试: EuroBERT 可以阅读长达 8,192 个 token(约 6,000–8,000 个单词)的文档而不会感到困惑或忘记开头。旧模型往往会在长篇故事中“忘记”开头,但 EuroBERT 能记住。
5. 一些令人惊讶的发现
在构建 EuroBERT 的过程中,团队学到了一些反直觉的事实:
- 质量并非一切: 他们原以为只给模型喂食最高质量、最具教育意义的文本会让它变得更聪明。事实并非如此。当模型摄入更广泛的数据组合(包括一些并非严格“教育类”的内容)时,表现反而更好。
- 英语越少越好: 他们减少了英语数据的比例,增加了其他语言的比例。这使模型更加平衡,并能更好地理解非英语语言。
- 代码有助于一切: 在训练数据中加入编程代码不仅有助于完成编程任务,实际上还让模型在处理普通文本时也能更好地寻找信息。
核心结论
作者将 EuroBERT 作为免费工具发布供所有人使用。它是一套包含三个模型(小型、中型和大型)的集合,目前是处理欧洲及全球语言的最佳“全能型”图书管理员。他们证明了,你不一定非要成为一名“讲故事的人”(生成式 AI)才能拥有强大的力量;一个经过良好训练的“理解者”(编码器)仍然可以是搜索、分类和分析文本的最佳工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。