← 最新论文
💬 NLP

M2POM^2PO: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

该论文提出了 M2POM^2PO,这是一个以数据为中心的框架,通过采用双视角课程学习和多对偏好目标,解决了质量评估模型偏向流畅性而非忠实性的问题,使 9B 参数的模型能够实现与领先的专有系统相媲美的翻译质量。

原作者: Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何进行语言翻译。你不仅希望它能说得流利,还希望它能做到“诚实”。在人工智能的世界里,这就是“圆滑的骗子”与“诚实的讲故事者”之间的区别。长期以来,科学家们一直试图通过一种被称为“强化学习”的方法,使这些庞大的语言模型符合人类的偏好。把这想象成训练一只狗:当它做得对时,你给它一个奖励(零食);当它搞砸时,你给它一个温柔的“不”。难点在于确定究竟什么才算“对”。通常,我们使用自动化的评分卡来给机器人的工作打分。但问题在于,这些评分卡有时很容易被欺骗。它们可能会给一段听起来优美流畅、但实际上是在捏造事实或遗漏重要细节的翻译打高分。这就像一个学生写了一首辞藻华丽的诗,却忘了回答考试中的实际问题。机器人因为文采得到了金星,但老师知道意思错了。这是一个大问题,因为如果机器人认为自己在表现出色,而实际上却在撒谎,它就会持续撒谎下去。

这正是 M2PO 论文背后的研究人员试图解决的谜题。他们注意到,用于给翻译评分的标准“评分卡”存在盲点。它们擅长识别明显的灾难(如乱码)和完美的翻译,但在中间地带会感到困惑。这个中间地带就是作者所称的**“不确定区”(Zone of Uncertainty)**。在这个区域内,一段翻译可能遗漏了几个关键细节,或者添加了一点点编造的信息,但因为它听起来依然流利,评分卡仍会给它一个高分。机器人看到这个高分后会想:“太棒了,我做得很好!”并由此不断犯下这些细微的错误。

为了解决这个问题,该团队发明了一种名为 M2PO(多视角多对偏好优化,Multi-Perspective Multi-Pair Preference Optimization)的新型训练框架。M2PO 不仅仅是看最终的分数,而是通过两种巧妙的方式改变了机器人学习的方式。首先,它扮演着一名严厉编辑的角色,不仅检查句子的流动性,还会检查故事是否真实。他们使用了一个特殊的“真相检测器”(称为语义对齐分类器),对于任何捏造事实或遗漏信息的翻译,即使听起来很优美,也会给予严厉的惩罚。这确保了机器人明白,仅仅流利是不够的;它必须忠实于原文。

其次,M2PO 将游戏规则从简单的“最好 vs 最差”对比转变为一场全面的锦标赛。通常,训练只关注单个最好的翻译和单个最差的翻译。但研究人员意识到,最重要的教训隐藏在中间——即那些几乎正确但带有那些隐蔽、细微错误的翻译。M2PO 将所有可能的翻译按从优到劣排列,并强迫机器人进行两两对比。这就像一位教练,不仅向球员展示金牌获得者和最后一名,还会指出那个犯了微小错误的亚军,并说:“看清区别了吗?这就是你需要修正的地方。”

这种新方法的测试结果令人印象深刻。当他们在一个 90 亿参数的模型(规模很大,但并非世界之最)上进行测试时,机器人的翻译水平变得如此出色,以至于能够击败许多更大的开源模型,甚至媲美 GPT-4o 和 Gemini-2.0-Flash 等昂贵的商业系统。该论文表明,通过修复“评分卡”偏差,并教会机器人关注那些棘手的中间地带错误,我们可以创造出不仅流利而且真正可靠的翻译工具。作者发现,这种方法在不同的语言和数据集上都行之有效,证明了更聪明的训练方式可以与单纯扩大机器人规模的力量相媲美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →