← 最新论文
💬 NLP

BM25-Augmented Many-Shot Translation for Low-Resource North-Eastern Indian Languages

本文介绍了佛罗里达大学小鳄鱼队(University of Florida Gators)的 WMT26 提交方案,该方案采用了一种检索增强的多样本翻译流水线,利用 BM25 获取相关的平行示例,并使用 Gemini 2.5 Flash 进行推理,在无需任何模型微调的情况下实现了对十一种东北印度语言的英语翻译。

原作者: Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Christan Grant, Daisy Zhe Wang

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Aashish Dhawan, Christopher Driggers-Ellis, Dzmitry Kasinets, Christan Grant, Daisy Zhe Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机可以讲述地球上每一种语言的世界:它能瞬间将喜马拉雅山脉偏远村庄的一首诗,翻译成发往纽约的一条短信。这就是机器翻译的梦想——在这个领域,计算机学习如何在不同语言之间交换词汇。多年来,教导这些计算机的标准方法是“微调”(fine-tuning),这就像是带一个聪明的学生,强迫他死记硬背一本特定的教科书,直到他能完美地背诵出来。但如果这个学生没有那本教科书呢?如果这种语言如此罕见,以至于只有极少数人曾将其记录下来呢?这就是“低资源”语言所面临的挑战。为了解决这个问题,研究人员正在尝试另一种技巧:与其让计算机死记硬背,不如在它回答之前给它一份“参考表”。他们使用一种搜索工具,寻找计算机以前见过的相似句子,并告诉它:“看,上次我们是这样说的;模仿这种风格。”本文探讨了这种“检索增强”(retrieval-augmented)方法是否适用于来自印度东北部的十一种非常罕见的语言,这些语言几乎没有数字历史记录。

来自佛罗里达大学的团队(自称为“gators”)构建了一个能够在英语与这十一种印度东北部语言之间进行翻译的系统。他们并没有试图从头开始训练一个新大脑,而是使用了一个巧妙的两步流程。首先,他们扮演一名使用名为 BM25 工具的图书管理员。当一个句子进来时,图书管理员会快速扫描庞大的现有翻译库,以找到最相似的例子。其次,他们将这些例子交给一个名为 Gemini 2.5 Flash 的超级智能 AI 模型,并说:“这里有一些关于如何翻译这类句子的例子;现在请你来做。”核心发现是,这种“检索增强”的方法(即 AI 实时查找示例)产生的结果具有竞争力,并且在许多情况下略优于其他团队使用的微调模型。

研究人员在十一种语言上测试了该系统,这些语言涵盖了从拥有较多数据的阿萨姆语(Assamese)到几乎没有任何先前翻译工作的塔金语(Tagin)和卡比语(Karbi)。他们通过结合来自一项名为 WMT26 竞赛的官方数据和其他公开文本集,构建了一个“训练库”。随后,他们进行了一场大规模实验,尝试不同的“参考表”示例数量。他们问道:“如果我们向 AI 展示 20 个例子,是否比展示 80 个更好?如果我们在练习测试中展示 10 个例子对比展示 40 个呢?”他们为每种语言和每个翻译方向(英语到当地语言,以及反向)测试了每种组合。

结果既有成功,也有有趣的发现。对于像阿萨姆语和博多语(Bodo)这样数据较多的语言,该系统的表现非常出色,在特定指标上取得了领先地位。具体而言,他们的这种方法在 19 项翻译任务中获得了最高的 BLEU 分数,并在 22 项任务中获得了最高的 ChrF++ 分数。对于像塔金语这样极其微小的语言,系统虽然仍能生成翻译,但得分较低。一个主要的发现是,当示例与被翻译的句子非常相似时,“参考表”的效果最好。然而,他们也发现,仅仅增加更多的数据并不总是有效。在一次实验中,他们尝试添加来自不同类型文本(图像说明)的合成数据(计算机生成的翻译),但这反而使翻译效果变差了。这教会了他们,拥有正确类型的示例比拥有一大堆错误的示例更为重要。

团队还修复了他们之前工作中的一个错误。在之前的项目中,他们不小心使用了错误的语言侧来构建搜索库,这让系统感到困惑。一旦修复了这个错误,系统在将当地语言翻译回英语方面突然变得更好了。他们还注意到,对于某些语言,向 AI 展示几个来自练习集的高质量示例,比展示大量来自主库的随机示例更有帮助。

最后,本文表明,你不一定非要从头开始教计算机一种语言。有时,只需给它一个好的搜索工具和一些好的示例供其参考即可。该系统并非只是在猜测;它通过特定的分数(如 ChrF++ 和 BLEU)来衡量其成功,并发现,在大多数翻译任务中,其方法属于最顶尖的行列。虽然该系统并不完美——有时会被政治话题或非常罕见的词汇所困扰——但它证明了对于这些难以触及的语言,一种聪明的“图书管理员”方法是弥合语言鸿沟的强大手段。作者认为,只要我们能找到展示给 AI 看的正确示例,这种方法将成为翻译世界上最具濒危性的语言的有力竞争者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →