← 最新论文
💬 NLP

EuroLLM-22B: Technical Report

本文介绍了 EuroLLM-22B,这是一个从零开始训练的大型语言模型,旨在支持 35 种语言(包括所有 24 种欧盟官方语言),在解决现有模型中欧洲语言代表性不足问题的同时,在推理、指令遵循和翻译方面取得了具有竞争力的性能,并且发布了所有相关数据集、模型和代码以支持未来的研究。

原作者: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Ma
发布于 2026-02-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

EuroLLM-22B:欧洲的多语言图书管理员

想象一下,人工智能的世界就像一座巨大的图书馆。长期以来,这座图书馆一直由英文书籍所主导。如果你走进图书馆并要求看一本法语、德语或葡萄牙语的故事书,你可能会找到几本,但它们通常是英文故事的翻译版本,或者是由并不完全理解当地文化的作者编写的。

EuroLLM-22B 是一个旨在解决这一问题的新型大规模项目。它是一个“大语言模型”(可以把它想象成一位超级聪明的数字图书管理员),从零开始构建,专门用于在欧盟所有 24 种官方语言以及包括阿拉伯语、中文和日语在内的其他 11 种主要语言中进行交流、理解和推理。

以下是该团队如何构建这位数字图书管理员的介绍,采用简单易懂的方式进行解释:

1. 蓝图(架构)

在盖房子之前,你需要一份蓝图。该团队并没有仅仅复制粘贴现有的设计,而是对蓝图进行了微调,以处理海量的信息。

  • 规模: 该模型拥有 220 亿个“神经元”(参数)。用一个类比来说,如果之前的版本(9B)是一个聪明的高中生,那么这个版本就是一个拥有庞大记忆力的资深大学教授。
  • 长效记忆: 其中一个最大的升级是“上下文窗口”。想象一下尝试阅读一部小说。旧的模型可能只能记住最后几页的内容,然后就会忘记开头。EuroLLM-22B 的大脑中可以同时容纳 32,000 个单词。它可以阅读一整个短篇故事或一份长篇法律文件,并能记住从第一页到最后一页的所有细节而不会迷失。

2. 训练食谱(数据)

没有优质的食材,就无法培养出伟大的厨师。团队在训练过程中对喂给模型的“食物”非常挑剔。

  • 过滤器: 他们并没有将整个互联网的数据直接倾倒进模型。他们使用了一个特殊的过滤器(称为 EuroFilter)来对文本质量进行评分(从 0 到 5 分)。他们丢弃了垃圾内容(如随机代码或低质量网页),只保留了高质量的教育和文学内容。
  • 阶段: 他们分三个阶段训练模型,就像学生升学一样:
    1. 小学阶段: 他们从海量的通用数据开始,教授基础知识。
    2. 高中阶段: 他们引入了更高质量的数据来精炼其推理能力。
    3. 研究生阶段: 在最后一个阶段,他们喂给了模型目前可获得的最好的数据,包括复杂的数学、编程和翻译书籍,以磨练其智能。
  • 语言混合: 与其他侧重于英文的模型不同,EuroLLM-22B 从第一天起就摄入了平衡的欧洲语言饮食,确保它不会偏袒其中任何一种语言。

3. 最后的润色(指令微调)

在模型学习完事实之后,它还需要学习如何表现。这被称为“后训练”。

  • 课堂: 团队使用了一个名为 EuroBlocks 的新数据集。想象一下这是一个涵盖了从“写一首关于雨的诗”到“解决这个数学问题”再到“翻译这个句子”等各种练习题和答案的大型集合。
  • 老师: 他们使用其他先进的 AI 模型来为这些问题生成高质量的答案,然后挑选出最好的答案来教导 EuroLLM-22B 如何精确地遵循指令。他们移除了任何“推理痕迹”(内部独白),使最终输出变得简洁直接。

4. 成绩单(结果)

团队将 EuroLLM-22B 与其他著名的 AI 模型进行了对比测试,以观察其表现如何。

  • 竞争对手: 他们将其与其它“完全开源”(代码和权重免费供任何人使用)的模型以及一些“开放权重”(你可以使用模型但无法看到其构建方式)的模型进行了比较。
  • 结果:
    • 欧洲冠军: 在欧洲制造的完全开源模型中,EuroLLM-22B 是最强大的。它的表现优于其他欧洲模型,甚至超过了一些规模更大的模型(如 700 亿参数的模型)。
    • 翻译: 它在语言翻译方面表现出色,其性能往往能媲美规模是其两倍的模型。
    • 推理: 它在逻辑谜题、数学和遵循复杂指令方面表现非常优秀。
    • 效率: 论文指出,与使用 15 万亿词汇的某些竞争对手相比,EuroLLM-22B 以“适度”的训练数据量(4 万亿词汇)就达到了这些成果,这表明高质量的数据比单纯的海量数据更为重要。

5. 给世界的礼物

这份论文最重要的部分在于,团队并没有将这座图书馆据为己有。他们向公众发布了所有内容:

  • 模型: 包括“基础”版本(原始大脑)和“指令”版本(得力助手)。
  • 数据: 用于训练模型的实际数据集(EuroWeb 和 EuroBlocks),以便其他研究人员进行学习。
  • 代码: 他们用于构建和测试模型的软件工具。

总结: EuroLLM-22B 是一个强大的开源 AI 工具,旨在确保欧洲语言在人工智能革命中不会掉队。它证明了通过精心的数据选择和对质量的关注,你可以构建出一个能够流利使用你的语言、且无需依赖封闭、秘密项目的世界级 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →