← 最新论文
💻 computer science

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

本文介绍了 MultiSynt/MT,这是一个通过翻译高质量英文数据生成的、涵盖 36 种欧洲语言且包含 4.8 万亿标记的开源合成平行语料库,它使多语言大语言模型能够以显著少于原生数据基准的预训练标记量实现卓越性能,同时也揭示了当前基准测试中存在的特定评估盲点。

原作者: Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Gi
发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的、超级聪明的机器人说并理解 36 种不同的语言。问题在于,机器人的最爱老师(互联网)主要使用英语进行交流。虽然有堆积如山的英文书籍、文章和网站,但对于像马耳他语、爱尔兰语或冰岛语这类语言,高质量的文本却只有零星、落满灰尘的小堆。

这篇论文的作者们通过构建一个庞大的“翻译工厂”解决了这个问题,这个项目被称为 MultiSynt/MT

核心理念:翻译工厂

他们并没有等待人们在 36 种语言中写出 4.8 万亿个新单词(这需要耗费太长时间),而是将 100 亿份高质量英文文档(即“Nemotron-CC”数据集)通过一台超先进的翻译机进行了处理。

你可以这样理解:

  • 源头: 一个汇集了现有最佳英文写作内容的图书馆。
  • 工人: 他们不仅仅使用了一台翻译机。他们使用了一个由不同 AI 翻译器组成的团队(有些像是专业的语言学家,有些则是通用的智能机器人)将每一句英文都翻译成了 36 种目标语言。
  • 结果: 一个包含 4.8 万亿个 Token(单词和符号)的新图书馆,涵盖了那 36 种语言。对于许多较小的欧洲语言来说,这个新图书馆的规模比之前存在的任何免费图书馆都要大 100 倍

实验: “翻译”真的有效吗?

团队使用这个庞大的翻译库训练了一个新的 AI 模型,并将其与使用“原生”数据(即用这些语言原本由人类编写的文本)训练的模型进行了对比。

令人惊喜的结果:
使用翻译数据训练的模型表现得比原生模型更好,而且它仅使用了 72% 的训练时间和数据

  • 类比: 想象两个正在参加考试的学生。学生 A(原生型)学习了一本厚重的教科书。学生 B(翻译型)学习了一份精简且高质量的摘要。学生 B 不仅通过了考试,而且得分更高,而且完成这一切所用的时间不到一半。

然而,论文警告说,这并不是解决所有问题的万灵药。

陷阱:“语言的恐怖谷”

虽然翻译数据在通用知识和逻辑方面表现出色,但它有一个特定的弱点:文化与习语

  • 隐喻: 想象一个完美背诵了短语手册的游客。他可以流利地订餐和问路(通用任务)。但如果你问他关于当地的一个笑话、一个特定的历史典故,或者只有当地人才会使用的俚语,他可能会出错,因为那个短语手册是从英文翻译过来的,而不是诞生于当地文化。
  • 发现: 当团队在涉及挪威本土习语或文化细微差别的任务上测试该 AI 时,使用原生人类写作训练的模型仍然胜出。翻译模型的语言很流利,但缺乏当地文化的“灵魂”。

测试中的“盲点”

论文还发现了一个关于我们通常如何测试 AI 的有趣缺陷。

  • 问题: 大多数测试都是选择题(就像标准化考试)。这些测试就像是“填空游戏”。它们无法分辨出一个句子听起来是完全自然的,还是听起来略显生硬或具有机器人感(这种现象被称为“翻译腔”)。
  • 发现: 当研究人员使用另一种测试方法——让 AI 写一个故事,并让另一个 AI 来评判写作的流畅度美感时,他们发现翻译模型确实存在微妙的差异。标准测试对这些质量差距是“盲目”的,但“故事评判员”却能清晰地看到它们。

结论

论文得出结论:翻译数据是强大的补充,而非完美的替代品。

  • 对于小语种: 它是救星。它在原本不存在大量高质量数据的地方提供了海量的数据支持。
  • 对于大语种: 它是填补空白的好方法。
  • 最佳策略: 利用翻译数据来建立坚实的基础,但要保留原生的人类数据,用来教导 AI 那些机器无法凭空创造的文化细微差别、笑话和地方特色。

作者们已经免费发布了这个庞大的“翻译图书馆”,允许其他研究人员通过实验,探索如何最好地将这些翻译文本与原生文本结合,以构建下一代多语言 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →