← 最新论文
💬 NLP

EuroBERT: Scaling Multilingual Encoders for European Languages

本文介绍了 EuroBERT,这是一个涵盖欧洲及全球语言的多语言编码器系列,它利用最新的生成式模型创新,在多种任务中超越了现有的替代方案,同时原生支持长达 8,192 个标记的序列。

原作者: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alve
发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alves, Kevin El Haddad, Manuel Faysse, Maxime Peyrard, Nuno M. Guerreiro, Patrick Fernandes, Ricardo Rei, Pierre Colombo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个庞大的图书馆,里面收藏着用数十种欧洲语言编写的书籍,此外还有一些代码和数学教科书。长期以来,那些能够阅读并理解所有这些书籍的“图书管理员”(AI 模型)一直显得有些过时。与此同时,新一代的“讲故事的人”(生成式 AI)却一直备受关注,因为他们可以从头开始创作新的故事。

这篇论文的作者提出了一个简单的问题:“我们为什么要忽视这些图书管理员?难道我们不能让他们的智力赶上那些讲故事的人吗?”

他们构建了一个名为 EuroBERT 的新一代图书管理员家族。以下是他们实现这一目标的简要过程:

1. 新型图书管理员的工具箱(架构)

旧的图书管理员使用一种标准但略显笨拙的方式来组织信息。EuroBERT 使用了从最先进的“讲故事者”那里借鉴而来的全新工具箱。

  • 类比: 把旧的图书管理员想象成一个拿着放大镜逐行阅读书籍的人。EuroBERT 则像是一个能够瞬间扫描整页、瞬间理解上下文,并在不产生混乱的情况下记住所有位置信息的图书管理员。他们移除了不必要的“杂质”(偏差),并添加了超快速的记忆工具(如旋转位置嵌入/Rotary Position Embeddings),以处理非常长的文档而不会迷失方向。

2. 训练食谱(数据)

要让这些图书管理员变得聪明,你必须给他们喂食正确的食物。

  • 盛宴: 他们用高达 5 万亿个词汇(token)的海量数据来训练 EuroBERT。这不仅仅是随机的网络闲聊,而是一个精心策划的混合体,包括:
    • 15 种语言: 包括主要的欧洲语言(如法语、德语、西班牙语)以及广泛使用的全球语言(如中文、阿拉伯语、印地语)。
    • 专业学科: 他们不仅喂给他们故事,还喂给了他们代码(编程语言)和数学
    • 结果: 正如一个学习了历史、数学和编程的学生会成为更好的问题解决者一样,EuroBERT 也变得更擅长在所有这些不同主题之间寻找信息。

3. 两阶段训练法(配方)

他们并没有一次性把所有的书都倒给图书管理员。他们使用了两步烹饪法:

  • 第一阶段:预训练(草稿阶段): 他们向模型输入了大量多样化的数据,以学习语言、代码和数学的基础知识。在这个阶段,他们玩了一个游戏:隐藏 50% 的单词并要求模型猜出它们。这迫使模型真正去关注上下文。
  • 第二阶段:退火处理(润色阶段): 这是“最后的点睛之笔”。他们对模型进行了第二次、更具针对性的饮食调整。他们调整了混合比例,加入了更多高质量的教育材料和平行翻译文本(两种语言并排呈现的句子)。至关重要的是,他们改变了游戏规则:不再隐藏 50% 的单词,而是只隐藏 10%。这有助于模型更好地理解完整的句子,而不仅仅是猜测缺失的单词。

4. 结果:他们有多强?

作者通过一系列“考试”,将 EuroBERT 与其他著名的图书管理员(如 XLM-RoBERTa 和 mGTE)进行了对比测试:

  • 搜索测试(检索): 如果你问:“请帮我找一篇关于可再生能源的法语文档”,EuroBERT 能够极其快速且准确地找到正确页面。
  • 理解测试(分类): 如果你展示一个句子并问:“这是积极的还是消极的?”或者“这两句话的意思是否相同?”,它比竞争对手更能准确回答。
  • 利基测试(代码与数学): 这是 EuroBERT 最闪耀的地方。由于他们喂给了它数学和代码,它在理解编程语言和数学公式方面明显优于其他同等规模的模型。
  • 长文档测试: EuroBERT 可以阅读长达 8,192 个 token(约 6,000–8,000 个单词)的文档而不会感到困惑或忘记开头。旧模型往往会在长篇故事中“忘记”开头,但 EuroBERT 能记住。

5. 一些令人惊讶的发现

在构建 EuroBERT 的过程中,团队学到了一些反直觉的事实:

  • 质量并非一切: 他们原以为只给模型喂食最高质量、最具教育意义的文本会让它变得更聪明。事实并非如此。当模型摄入更广泛的数据组合(包括一些并非严格“教育类”的内容)时,表现反而更好。
  • 英语越少越好: 他们减少了英语数据的比例,增加了其他语言的比例。这使模型更加平衡,并能更好地理解非英语语言。
  • 代码有助于一切: 在训练数据中加入编程代码不仅有助于完成编程任务,实际上还让模型在处理普通文本时也能更好地寻找信息。

核心结论

作者将 EuroBERT 作为免费工具发布供所有人使用。它是一套包含三个模型(小型、中型和大型)的集合,目前是处理欧洲及全球语言的最佳“全能型”图书管理员。他们证明了,你不一定非要成为一名“讲故事的人”(生成式 AI)才能拥有强大的力量;一个经过良好训练的“理解者”(编码器)仍然可以是搜索、分类和分析文本的最佳工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →