← 最新论文
💬 NLP

DIETA: A Decoder-only transformer-based model for Italian-English machine TrAnslation

本文介绍了 DIETA,这是一个拥有 5 亿参数的仅解码器(decoder-only)Transformer 模型,该模型是在一个经过精选的 2.07 亿句意语-英语语料库及回译数据上训练而成,其在基准测试中取得了具有竞争力的性能,并随之公开了其训练脚本、模型、数据以及一个新的评估集。

原作者: Pranav Kasela, Marco Braga, Alessandro Ghiotto, Andrea Pilzer, Marco Viviani, Alessandro Raganato

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Pranav Kasela, Marco Braga, Alessandro Ghiotto, Andrea Pilzer, Marco Viviani, Alessandro Raganato

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想构建一个只能说两种语言的翻译器:意大利语和英语。大多数大型科技公司都在构建“通用翻译器”,试图同时处理 100 种语言。这些翻译器就像背着沉重背包的旅行者,里面装满了全世界所有的字典。它们功能强大,但也非常庞大、运行成本高昂,而且有时会因为试图记住太多东西而感到困惑。

这篇论文的作者决定构建一些不同的东西:一个名为 DIETA专业化、轻量化翻译器

以下是他们构建它的故事,使用了简单的类比:

1. 目标:专业运动员,而非马拉松选手

他们没有训练一个能说每种语言的巨型模型(就像一个试图跑完所有距离的马拉松选手),而是训练了一个只有 0.5 亿参数的小型模型,旨在成为意大利语和英语领域的绝对专家。

  • 隐喻: 把 DIETA 想象成一名短跑运动员。它不需要背负 100 种语言的重量;它只需要在意大利语-英语的赛道上跑得极其快速且精准。

2. 训练数据:“健身房”

要练好任何东西,你都需要练习。该团队并没有仅仅使用几本教科书;他们建造了一个拥有 7.68 亿个练习句子的巨大“健身房”。

  • 真实素材: 他们从议会记录、法律文件、新闻、电影(字幕)和书籍中收集了约 2.07 亿个真实的句子对。
  • “幽灵”练习(回译): 由于他们需要更多的练习,他们使用了一种被称为“回译”的聪明技巧。想象一下,拿一篇意大利语新闻文章,用计算机将其翻译成英语,然后让计算机再将那段英语翻译回意大利语。这创造了一种新的“合成”练习对。他们进行了数百万次这样的操作,从而创建了一个包含 3.52 亿个额外句子的庞大库。
  • 结果: 该模型在真实的人类写作和这种大量的计算机生成练习数据的混合体上进行了练习。

3. 新测试:“新鲜新闻”考试

通常,翻译模型是在陈旧、静态的数据上进行测试的。作者意识到,这并不能告诉你一个模型是否能处理今天的新闻。

  • 创新点: 他们创建了一个名为 WikiNews-25 的新测试集,其基础是来自 2025 年的文章。
  • 难点: 他们不仅仅使用了任何句子。他们提取了 Google 生成的翻译,找到了其中错误的翻译,并请人工进行了修正。这创造了一个专门用于测试模型如何处理当前、现实世界新闻的“金标准”考试。

4. 结果:以小博大

他们让 DIETA 与 32 个其他翻译器进行比赛,这些翻译器的规模从微型模型到拥有 90 亿参数的巨型模型(即前文提到的“沉重背包”)不等。

  • 表现: 尽管 DIETA 非常小(仅 0.5 亿参数),但它始终稳定地处于第二梯队(第二四分位数)。
  • 对比: 它击败了几乎所有比它规模在 30 亿参数以下的模型。事实上,在五项不同测试中的四项中,它的表现优于几乎所有其他小型模型。
  • 权衡: 它并不像那些 90 亿参数的“超级运动员”(巨型模型)那样完美,但在其他方面,它与巨型模型非常接近。唯一的差距在于“无参考评分”(即在没有完美答案的情况下猜测质量)方面,在那里巨型模型仍然占据优势,但除此之外,DIETA 都能独当一面。

5. 为什么这很重要

论文声称,你并不总是需要一个庞大、昂贵的超级计算机来获得出色的翻译结果。

  • 核心启示: 如果你将训练数据专门针对两种语言,并使用大量的智能合成练习数据,那么一个小型、轻量级的模型可以完成通常需要更庞大、更沉重的模型才能完成的工作。
  • 可及性: 由于 DIETA 非常小,它可以在单个消费级显卡(如高端游戏 PC)上运行,而巨型模型则需要大规模的数据中心。

总结

作者构建了 DIETA,一个专门用于意大利语和英语的小型翻译器。他们利用大量真实文档和计算机生成的练习句子对其进行了训练。结果如何?一个微型模型,其表现几乎可以媲美那些巨型模型,这证明了专业化训练和智能数据可以战胜单纯的规模大小

他们已向所有人开放了该模型、训练数据以及新的测试集,以便他人可以从中学习并构建更好的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →