Building Large-Scale English-Romanian Literary Translation Resources with Open Models
本文介绍了 TinyFabulist 翻译框架 (TF2),这是一个统一的流水线,它利用合成数据和两阶段微调过程,旨在产出一个具有成本效益的、用于高质量英译罗文学翻译的开放式 12B 参数模型,并同时发布大规模数据集和评估工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个故事是文化货币的世界,但有些语言就像是与世隔绝的孤岛,几乎没有通往外界的桥梁。这就是机器翻译面临的挑战——它是人工智能的一个分支,试图教会计算机使用不同的语言。通常,这些计算机通过阅读人类编写的数百万本书籍和新闻文章来学习。但对于许多语言,尤其是那些使用人数较少的语言,并没有足够的书籍来教导计算机。这就像是在从未见过食谱或品尝过番茄的情况下,试图学习如何烹饪意大利菜。
为了解决这个问题,科学家们开始使用大语言模型(LLMs)。把它们想象成超级聪明的数字大厨,他们已经品尝过世界上几乎所有的菜肴,并且可以推测出新食谱的味道应该如何。然而,教这些大厨去烹饪“文学”——即带有情感、笑话和文化秘密的故事——要比翻译一份新闻报告难得多。而且,对于像罗马尼亚语这样数字资源不如英语丰富的语言,这就像是在一个食材有限且预算紧缩的厨房里烘焙一个完美的蛋糕。研究人员提出的重大问题是:我们能否在不挥霍巨资或不需要超级计算机的情况下,建立一个高质量的翻译故事库?
小寓言家(Tiny Fabulist)的故事
在这篇论文中,来自罗马尼亚的一个研究小组介绍了一个名为 TF2(TinyFabulist Translation 框架) 的新项目。他们的目标是创建一个大规模的翻译寓言库——即像伊索寓言那样具有道德教益的短篇故事——实现从英语到罗马尼亚语的转换。他们想看看是否可以使用“开放式”模型(免费、公开的 AI 工具)而不是昂贵的私有模型来实现这一目标,并且是否能在极低的预算下完成。
配方:从零开始构建图书馆
研究人员知道,他们不能只是要求人类去翻译数百万个故事,因为那会耗时且成本过高。相反,他们建立了一个四步走的流水线来亲自创建数据:
- 口味测试(第一阶段): 首先,他们测试了 13 种不同的 AI 模型(包括免费和付费模型),以观察哪一个最擅长翻译一些样本寓言。他们不仅看单词是否匹配,还要求 AI 根据五个维度对翻译进行评分:准确性、流畅度、故事逻辑、风格和文化契合度。最终的获胜者是一个名为 GPT-o3 的强大模型,它成为了他们创建其余库内容的“金标准”。
- 银标标准(第二阶段): 利用这个获胜的模型,他们将 15,000 个英语寓言翻译成了罗马尼亚语。尽管这些是由机器人制作的,但它们非常出色,以至于研究人员将它们视为“银标标准”(几乎达到黄金标准),用于训练他们自己的定制模型。
- 专业化训练(第三阶段): 这是神奇之处。他们采用了开源 AI 模型(具体来说是 Gemma 的不同版本,范围从 10 亿参数的小型模型到 120 亿参数的模型),并为它们开设了一所特殊的“进修学校”。他们使用了一种称为 LoRA(低秩自适应)的技术,这就像是给一位全能大厨一本专门针对寓言的食谱,而无需重建整个厨房。他们在 15,000 个翻译故事上对这些模型进行了训练。
- 大规模生产(第四阶段): 最后,他们使用这些新训练的、专业化的模型来翻译原始英语收藏中的剩余 300 万 个寓言。其结果是一个庞大的新数据集,名为 DS-TF2-EN-RO-3M,其中包含 300 万对英、罗寓言。
结果:小模型,大惊喜
研究人员随后将他们的新训练模型与大型、昂贵的私有模型(如 GPT-4 和 DeepL)以及原始的未训练开源模型进行了对比测试。
- 差距缩小: 他们表现最好的开源模型 TF2-12B(120 亿参数版本)表现得非常出色。在他们的质量评分表中,该模型获得了 4.83(满分 5 分)的平均分,而顶尖的私有模型(GPT-o3)得分则为 4.92。这个免费、定制训练的模型与昂贵的专有巨头之间的差距微乎其微——不到 0.1 分。
- 成本差异: 这正是故事最令人兴奋的地方。使用昂贵的私有 API 翻译所有 300 万个寓言,成本将在 1,800 美元到 32,400 美元 之间(取决于你选择哪个模型)。相比之下,他们的开源 TF2 模型完成了同样的工作,仅花费了约 350 美元。这意味着节省了 97% 到 99% 的成本。
- 小型模型: 即使是他们最小的模型(10 亿参数),在经过训练后,得分也从 2.02 跳升到了 3.75。它并不完美,但它从“勉强能懂”变成了“相当不错”,证明了即使是廉价的小型计算机,如果接受正确的训练,也是可以学会讲故事的。
他们的发现(以及未达到的目标)
论文指出,你并不需要成为亿万富翁才能构建高质量的文学翻译工具。通过使用一种聪明、循序渐进的过程,并专注于特定类型的故事(寓言),他们展示了开源模型可以与巨头抗衡。
然而,作者也谨慎地指出了一些情况:
- 尚未完美: 虽然开源模型已经很接近了,但私有模型(如 GPT-o3)在风格和文化细微差别方面得分仍然略高。开源模型是一个很好的替代方案,但它们还没有完全“解决”在每一个案例中都达到人类水平翻译质量的问题。
- “金标准”其实是“银标”: 他们用于训练模型的参考翻译是由另一个 AI 而非人类制作的。这意味着模型学习的是如何听起来像其他 AI,而不一定是像人类翻译家。研究人员通过让一名专家对一小部分故事进行人工检查来验证这一点,专家认为 AI 的排名大致是正确的,但他们承认需要更大规模的人类研究才能百分之百确定。
- 寓言具有特殊性: 寓言篇幅短小且结构清晰。研究人员建议,虽然这种方法对寓言非常有效,但若要应用于具有深层隐喻或历史对话的复杂小说,可能会更加困难。
总结
TF2 项目就像是在展示,你可以利用回收材料和一点点智慧来建造一座宏伟的图书馆,而不必需要一座金库。他们证明了,通过正确的训练数据和一种聪明且具有成本效益的方法,开源 AI 可以以极低的成本为罗马尼亚语等语言进行文学内容翻译。他们向公众发布了所有的代码、这个 300 万故事的数据集以及训练好的模型,邀请所有人基于他们的工作继续构建。这是迈向未来的一步——在那个未来,AI 可以帮助保护和分享来自每种文化的各种故事,无论该文化拥有多少技术资金。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。