← 最新论文
💻 computer science

Sense-Augmented Corpus for Sanskrit-English Machine Translation: Corpus Construction, Model Fine-Tuning, and Evaluation

本文通过利用大语言模型(LLM)和自定义义项库构建一个义项增强型平行语料库,解决了梵英机器翻译中的词汇歧义挑战,并证明了显式引入词义信息能显著提高不同模型架构的翻译质量。

原作者: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言不仅仅是词汇的集合;它是一个活生生的系统,其意义会随着词语所处环境的不同而发生变化。在语言研究中,一个单词可以戴上许多不同的帽子,这种概念被称为“一词多义”(polysemy)。对于人类读者而言,语境充当了引导者,能够瞬间明确一个词是指代物理对象、抽象概念还是某种动作。然而,对于计算机来说,这项任务是极其困难的。机器往往难以区分这些不同的含义,导致翻译结果虽然语法正确,但在语义上却令人困惑。这一问题在处理像梵文这样具有古老色彩的语言时尤为严重,因为这类语言中单个术语可能承载着数百年的细微差别,且相关的数字化资源十分匮乏。当机器无法领悟一个词的预期含义时,由此产生的翻译可能会丢失原文的精髓,将一段深刻的哲学陈述变成一串毫无意义的字符。

来自海得拉巴国际信息技术研究院(IIIT Hyderabad)和中央梵文大学的研究人员通过教导机器在尝试翻译之前,先密切关注单词的具体含义,从而应对了这一挑战。他们的工作重点在于为“梵英翻译”创建一种新型的训练数据。研究团队并非仅仅向计算机输入梵文句子及其对应的英文等价句,而是通过添加显式的标签来丰富这些配对,从而识别出句子中每个单词的确切含义。他们使用了一种强大的人工智能工具来充当“数字编纂学家”,阅读每个梵文句子,并从海量的字典中为每个单词选择正确的定义,就像人类学者所做的那样。这一过程产生了一个“语义增强型”语料库,即在这个数据集中,计算机不仅被展示了单词,还被明确告知了这些单词在特定语境下的确切含义。

该团队使用多种不同的翻译模型测试了这种方法,包括专门的翻译引擎和通用的大型语言模型。他们首先观察了这些模型在没有任何额外训练时的表现,这种状态被称为“零样本推理”(zero-shot inference)。正如预期的那样,模型表现挣扎,生成的翻译往往支离破碎,或者完全误解了原文的要点。例如,在翻译一个关于战士惊恐逃窜的句子时,一个基础模型可能会将表示“山中堡垒”的词简单地翻译成“森林”,从而错失了原史诗中的关键意象。当研究人员随后使用标准的平行句子对这些模型进行微调时,翻译质量有了显著提升,变得更加连贯且流畅。然而,最剧烈的质量飞跃发生在模型使用这种全新的、语义增强型数据进行训练之后。

结果显示,提供显式的语义信息能持续提高所有受测模型的翻译质量。机器在针对不同情况选择正确词汇的能力上得到了极大提升。在一个具体案例中,一个接受过语义增强数据训练的模型正确地将一个描述“大军”的短语翻译成了“军队”(army),而同一个模型如果仅接受标准数据训练,则会错误地将其翻译为“布料”(cloth),这种错误完全改变了场景的含义。另一个例子涉及一个既可以指“党派”也可以指“起因/事业”的词;增强后的模型正确地选择了指代人群的“党派/团体”,而标准模型则选择了“起因/事业”,这与语境不符。这些改进不仅仅是微小的调整,它们代表了模型理解文本方式的根本性转变,使得模型能够解决此前导致其失败的歧义问题。

研究还强调,即使是对于最初并非为翻译设计的通用人工智能模型,这种方法同样有效。一个通常在特定语言对上表现欠佳的通用模型,在接受语义增强数据训练后,其性能水平可以达到与专用翻译引擎相当的程度。这表明,提升翻译质量的关键不仅在于拥有更多的数据,更在于拥有具有语义丰富性的数据。研究人员发现,模型学会了做出更符合语境的选择,有效地减少了重复短语或生成无意义内容的情况——而这正是机器翻译中常见的错误。尽管创建这种富集数据集的过程需要巨大的计算能力和时间,但其回报清晰地证明了:教导机器进行显式的词义消歧,可以使翻译不仅更加准确,而且更加忠实于原语言的精神。

这项工作并不声称已经解决了机器翻译中的所有问题,也不认为目前的方法是完美的。研究人员指出,他们的语义清单极其详尽,有时反而会让模型在非常相似的含义之间难以抉择。他们也承认,该过程在计算上是昂贵的,且初始语义分配中的错误可能会影响最终的翻译。然而,这些发现提供了一条充满希望的前行之路,特别是对于数据稀缺的低资源语言。通过展示显式语义信息如何弥合人类理解与机器处理之间的鸿沟,这项研究为改进计算机如何与人类语言中复杂、多层次的含义进行交互提供了蓝图。最终的目标不仅仅是翻译单词,而是传达说话者的精确意图与细微差别,这需要一种只有通过细致的、具备语义感知能力的训练才能实现的理解力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →