EuroLLM-22B: Technical Report
本文介绍了 EuroLLM-22B,这是一个从零开始训练的大型语言模型,旨在支持 35 种语言(包括所有 24 种欧盟官方语言),在解决现有模型中欧洲语言代表性不足问题的同时,在推理、指令遵循和翻译方面取得了具有竞争力的性能,并且发布了所有相关数据集、模型和代码以支持未来的研究。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
EuroLLM-22B:欧洲的多语言图书管理员
想象一下,人工智能的世界就像一座巨大的图书馆。长期以来,这座图书馆一直由英文书籍所主导。如果你走进图书馆并要求看一本法语、德语或葡萄牙语的故事书,你可能会找到几本,但它们通常是英文故事的翻译版本,或者是由并不完全理解当地文化的作者编写的。
EuroLLM-22B 是一个旨在解决这一问题的新型大规模项目。它是一个“大语言模型”(可以把它想象成一位超级聪明的数字图书管理员),从零开始构建,专门用于在欧盟所有 24 种官方语言以及包括阿拉伯语、中文和日语在内的其他 11 种主要语言中进行交流、理解和推理。
以下是该团队如何构建这位数字图书管理员的介绍,采用简单易懂的方式进行解释:
1. 蓝图(架构)
在盖房子之前,你需要一份蓝图。该团队并没有仅仅复制粘贴现有的设计,而是对蓝图进行了微调,以处理海量的信息。
- 规模: 该模型拥有 220 亿个“神经元”(参数)。用一个类比来说,如果之前的版本(9B)是一个聪明的高中生,那么这个版本就是一个拥有庞大记忆力的资深大学教授。
- 长效记忆: 其中一个最大的升级是“上下文窗口”。想象一下尝试阅读一部小说。旧的模型可能只能记住最后几页的内容,然后就会忘记开头。EuroLLM-22B 的大脑中可以同时容纳 32,000 个单词。它可以阅读一整个短篇故事或一份长篇法律文件,并能记住从第一页到最后一页的所有细节而不会迷失。
2. 训练食谱(数据)
没有优质的食材,就无法培养出伟大的厨师。团队在训练过程中对喂给模型的“食物”非常挑剔。
- 过滤器: 他们并没有将整个互联网的数据直接倾倒进模型。他们使用了一个特殊的过滤器(称为 EuroFilter)来对文本质量进行评分(从 0 到 5 分)。他们丢弃了垃圾内容(如随机代码或低质量网页),只保留了高质量的教育和文学内容。
- 阶段: 他们分三个阶段训练模型,就像学生升学一样:
- 小学阶段: 他们从海量的通用数据开始,教授基础知识。
- 高中阶段: 他们引入了更高质量的数据来精炼其推理能力。
- 研究生阶段: 在最后一个阶段,他们喂给了模型目前可获得的最好的数据,包括复杂的数学、编程和翻译书籍,以磨练其智能。
- 语言混合: 与其他侧重于英文的模型不同,EuroLLM-22B 从第一天起就摄入了平衡的欧洲语言饮食,确保它不会偏袒其中任何一种语言。
3. 最后的润色(指令微调)
在模型学习完事实之后,它还需要学习如何表现。这被称为“后训练”。
- 课堂: 团队使用了一个名为 EuroBlocks 的新数据集。想象一下这是一个涵盖了从“写一首关于雨的诗”到“解决这个数学问题”再到“翻译这个句子”等各种练习题和答案的大型集合。
- 老师: 他们使用其他先进的 AI 模型来为这些问题生成高质量的答案,然后挑选出最好的答案来教导 EuroLLM-22B 如何精确地遵循指令。他们移除了任何“推理痕迹”(内部独白),使最终输出变得简洁直接。
4. 成绩单(结果)
团队将 EuroLLM-22B 与其他著名的 AI 模型进行了对比测试,以观察其表现如何。
- 竞争对手: 他们将其与其它“完全开源”(代码和权重免费供任何人使用)的模型以及一些“开放权重”(你可以使用模型但无法看到其构建方式)的模型进行了比较。
- 结果:
- 欧洲冠军: 在欧洲制造的完全开源模型中,EuroLLM-22B 是最强大的。它的表现优于其他欧洲模型,甚至超过了一些规模更大的模型(如 700 亿参数的模型)。
- 翻译: 它在语言翻译方面表现出色,其性能往往能媲美规模是其两倍的模型。
- 推理: 它在逻辑谜题、数学和遵循复杂指令方面表现非常优秀。
- 效率: 论文指出,与使用 15 万亿词汇的某些竞争对手相比,EuroLLM-22B 以“适度”的训练数据量(4 万亿词汇)就达到了这些成果,这表明高质量的数据比单纯的海量数据更为重要。
5. 给世界的礼物
这份论文最重要的部分在于,团队并没有将这座图书馆据为己有。他们向公众发布了所有内容:
- 模型: 包括“基础”版本(原始大脑)和“指令”版本(得力助手)。
- 数据: 用于训练模型的实际数据集(EuroWeb 和 EuroBlocks),以便其他研究人员进行学习。
- 代码: 他们用于构建和测试模型的软件工具。
总结: EuroLLM-22B 是一个强大的开源 AI 工具,旨在确保欧洲语言在人工智能革命中不会掉队。它证明了通过精心的数据选择和对质量的关注,你可以构建出一个能够流利使用你的语言、且无需依赖封闭、秘密项目的世界级 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。