← 最新论文
💻 computer science

A Semantic-Enhanced Multi-Task Framework with Structure-Aware Curriculum Learning for Low-Resource Neural Machine Translation

本文提出了一种具有结构感知课程学习的语义增强多任务框架,利用 Qwen2-7B-Instruct 和生成式语义角色标注来解决语义失配并优化训练动态,从而显著提升低资源神经机器翻译的性能。

原作者: Jingxing Gao, Liqing Wang, Xingwei Chen, Yongyue Xu

发布于 2026-09-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingxing Gao, Liqing Wang, Xingwei Chen, Yongyue Xu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是一个广阔且不断变化的景观,而对于计算机而言,其中的某些部分则是广袤的荒漠。在机器翻译领域——即软件学习如何将文本从一种语言转换为另一种语言——存在着一个持久的问题,即“低资源”语言问题。这些语言如老挝语或缅甸语,其可供计算机研究的数字化文本非常稀少。当研究人员试图教强大的语言模型翻译这些语言时,机器往往会踉跄跌倒。它们可能会发明不存在的词汇,或者更微妙地,它们可能会搞错词与词之间的关系。例如,一个句子可能会说政府“加强了”某项法规,但由于缺乏示例,计算机可能会感到困惑,从而完全丢掉动作,仅仅列出名词,使意义变得空洞。这是因为模型倾向于记忆简单的词对,而不是理解“谁对谁做了什么”的深层逻辑。

为了解决这个问题,研究人员尝试了两种主要方法。一种是教计算机了解句子的结构,特别是动作(谓词)是如何连接到涉及的人或物(论元)的。另一种方法是模仿人类的学习方式:从简单的例子开始,逐渐过渡到更难的例子,这种方法被称为课程学习(curriculum learning)。然而,以往结合这些想法的尝试往往以失败告终,因为计算机的学习过程会变得混乱,试图同时学习太多不同的事物并陷入停滞。来自云南大学的一项新研究提出了一种修复方法,即通过教计算机理解句子的“骨架”,同时引导它走过一条精心排序的学习路径。

研究人员构建了一个基于大语言模型的系统,这类人工智能已经学习了大量的人类语言知识。他们并没有尝试重新训练整个庞大的模型,因为那太昂贵且速度太慢。相反,他们添加了一个小的、灵活的指令层,可以轻松进行调整。这个层级的任务是同时学习三件事:将中文翻译成老挝语、识别重要名称(如人物和地点),以及识别单词在句子中扮演的角色,例如谁是动作的执行者,谁是动作的接收者。通过强迫计算机在翻译的同时生成这些结构性细节,该系统被迫去关注句子的深层逻辑,而非仅仅关注表层的词汇匹配。

然而,关键的创新在于他们向计算机喂送数据的方式。研究人员并没有一次性将所有的训练示例都投喂给模型,而是为每个句子创建了一个“难度评分”。这个评分不是基于句子的长度(这可能会产生误导),而是基于其内部结构的复杂程度。他们观察了有多少个动作发生、涉及多少参与者,以及相关词汇之间的距离有多远。随后,计算机首先只在最简单的句子上进行训练。随着它变得更加熟练,系统会逐步引入更复杂的句子,循序渐进地扩大示例池。这确保了模型在处理最错综复杂和困难的短语之前,已经掌握了语言结构的基础。

这种方法的成果是令人瞩目的。在测试中文翻译成老挝语时,这种新方法与标准训练方法相比,显著提高了翻译质量。研究人员使用一套标准的评分系统衡量了这种进步,发现他们的方法将分数提升了五分以上,这在这一领域是一个巨大的飞跃。它还超越了其他在大量多语言数据上进行过训练的现有大型预训练模型。该系统不仅学会了更好地翻译,还学会了更准确地翻译,保留了以往经常丢失的词与词之间的特定关系。例如,在政府“加强”规则的句子中,新系统能够正确保留动作,而旧方法往往会将其丢弃。

为了确保这不仅仅是针对特定语言对的一次偶然成功,研究人员在将中文翻译成缅甸语的任务上也测试了同样的系统。老挝语和缅甸语这两种语言共享相似的语法特征,高度依赖语序而非通过改变词尾来表达意义。该系统在缅甸语上的表现同样出色,比基准模型提高了近两分。这表明,通过循序渐进的课程来教授结构逻辑的方法,并非仅适用于某种特定语言的技巧,而是一种稳健的方法,可以帮助计算机理解那些缺乏大规模数字库的语言。

研究还观察了计算机随时间学习的过程。他们发现,当系统首次接触复杂的结构化任务时,其表现会出现轻微下降,即一个“冷启动”现象,此时模型在应对新的要求时显得力不从心。然而,一旦它跨越了这个初始障碍,其表现便会激增,最终超越了那些没有经过结构化引导训练的模型。课程学习法平滑了这个艰难的开端,帮助模型避免陷入不再进步的平台期。到训练结束时,系统已经发展出处理低资源语言复杂逻辑的稳定能力。

这项工作证明,对于缺乏数字化数据的语言,答案可能不在于单纯收集更多文本,而在于教计算机如何思考它已有的文本。通过将对句子结构的深度理解与耐心、循序渐进的学习计划相结合,研究人员展示了一条实现更可靠机器翻译的路径。研究结果表明,即使在缺乏大规模数据集的情况下,关于句子是如何构建的明确指导,也能帮助人工智能弥合语言之间的鸿沟,让那些长期被遗忘的语言重获生机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →