← 最新论文
💬 NLP

On-Policy Delta Distillation for Multilingual Math Reasoning

本文表明,利用训练后教师模型与其基座模型之间的概率差距,在策略内增量蒸馏(On-Policy Delta Distillation, OPD2^2)显著增强了韩语和日语的多语言数学推理能力并缩小了性能差距,同时也强调了需要多语言数据以防止以英语为中心的响应偏移。

原作者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机就像是那些读遍了图书馆所有书籍,却依然在解决棘手数学问题时感到吃力的才华横溢、精通多语种的学生。为了帮助他们变得更聪明,科学家们使用了一种叫做“训练”的技术,这有点像教练引导学生进行练习。长期以来,训练这些 AI 学生最好的方法是强化学习(Reinforcement Learning, RL),这种方法在整个答案结束后只给出一个最终成绩——就像是在不知道哪些句子好、哪些句子坏的情况下,直接给整篇论文打出一个“A”或“F”的等级。然而,一种更高效的新方法——**在策略蒸馏(On-Policy Distillation, OPD)**应运而生。OPD 不再等待最终成绩,而是像一位大师级的教师,在学生写作时逐字逐句地阅读,并在旁边低声进行纠正和建议。这种“词元级(token-level)”的反馈更加精准。但问题在于,大部分这类研究仅限于英语。我们不知道这种“耳语教师”技术在处理韩语、日语或其他语言的学生时是否同样有效,也不知道它是否能缩小 AI 在英语与其他语言表达能力之间的差距。

这篇论文深入探讨了正是这样一个问题,测试了一个被称为**在策略增量蒸馏(On-Policy Delta Distillation, OPD²)**的超强版本技术,并将其应用于英语、韩语和日语的数学推理任务。研究人员发现,这种新方法是一个游戏规则的改变者。就像一位名厨可以向任何语言的学生传授食谱一样,OPD² 帮助 AI 模型在所有三种语言中都能显著更好地解决数学问题,尤其是在韩语和日语方面取得了巨大的飞跃。研究表明,该方法甚至优于原始版本,因为它专注于“增量(delta)”——即老师所知与学生基础模型已知内容之间的特定差异——从而有效地隔离了正在教授的新型推理技能。

然而,论文也揭示了一个迷人且略显棘手的副作用。当研究人员尝试仅使用英语数学问题来教导 AI 时,模型竟然在解决韩语和日语数学问题方面也变得更强了。这看起来就像是学生通过英语学会了数学逻辑,并能将其应用到其他语言中。但有一个转折:虽然答案是正确的,但模型经常开始用英语书写其解释,即使问题是用韩语或日语提出的。这表明,虽然“推理肌肉”可以在一种语言中训练并转移到另一种语言,但要保持答案的“语调(voice)”处于目标语言中,则需要在该特定语言的数据上进行练习。最终,论文表明 OPD² 是让 AI 在跨语言领域变得更聪明的强大工具,但要真正精通一门语言,你仍然需要在练习中使用该语言。

核心发现:一位更好的耳语教师

研究人员旨在观察 OPD²(高级版的耳语教师)是否能在处理多种语言时优于原始的 OPD。他们使用了一个名为 Qwen3 的 AI 模型家族(具体为 1.7B 和 8B 版本)以及一个庞大的教师模型来进行引导。结果清晰且一致:OPD² 在各个方面都持续优于原始的 OPD

可以这样理解:如果说原始的 OPD 是一位优秀的导师,那么 OPD² 就是一位知道学生到底缺失了什么的天才导师。在实验中,这种差异在非英语语言中非常巨大。对于较小的模型(Qwen3-1.7B),OPD² 将韩语数学得分从 40.9 提升到了 51.9,将日语得分从 37.2 提升到了 52.0。原始的 OPD 虽然也有帮助,但 OPD² 将这些数字推向了更高的高度。对于更大、更聪明的模型(Qwen3-8B),提升同样强劲,韩语从 57.0 跳升至 64.4,日语从 57.1 跳升至 65.0

论文明确指出,这不仅仅是关于模仿老师的风格。通过使用“增量信号”(教师与其自身基础模型之间的差距),OPD² 成功地将推理能力转移给了学生,而不是仅仅模仿老师的通用输出。这表明该方法具有鲁棒性,且无论语言或模型大小如何,都能表现良好。

弥合语言差距

这项研究的一个主要目标是观察这些训练方法能否缩小英语与其他语言之间的性能差距。通常,AI 模型在英语方面的表现远优于韩语或日语。论文发现,多语言 OPD² 普遍有助于缩小这一差距

在对“英语-韩语准确率差距”的详细观察中,研究人员看到,虽然基础模型明显偏向英语(在某些测试中差距有时超过 13 分),但 OPD 训练减少了这种差异。例如,在 Global-MGSM 基准测试中,标准 OPD 将差距从 13.4 点缩小到了 8.6 点,而 OPD² 则进一步降至 9.3 点。在 HRM8K 基准测试中,差距从 12.1 降至 9.2 点。

论文认为,这是因为多语言训练对非英语语言的提升效果比对英语语言的效果更显著,从而在不拖累强势语言的前提下,有效地提升了表现较弱的语言。然而,作者谨慎地指出,这种效应并非在每一项指标上都完全统一;在某些特定基准(如 M-MMLU)上,差距实际上略微扩大了。因此,虽然趋势是积极的,但它并不是一个能瞬间修复所有指标的魔杖。

“仅限英语”的惊喜与语言陷阱

论文中最令人惊讶的发现或许是,当研究人员仅使用英语数据进行训练时发生了什么。你可能会认为,如果只教学生英语数学,他们会在韩语数学面前败下阵来。但论文发现,仅限英语的 OPD² 实际上显著提高了韩语和日语的得分

在非思考模式下,仅限英语的训练将韩语平均分从 40.9 提升到了 52.6,将日语平均分从 37.2 提升到了 53.4。这些数字几乎与多语言训练的得分(韩语为 51.9,日语为 52.0)不相上下。这表明数学推理的逻辑是如此具有普适性,以至于可以在英语中学习并应用到韩语或日语问题中,即使模型在训练期间从未见过一个韩语或日语的数学问题。

然而,这里有一个重大的限制条件。 论文明确排除了“这意味着模型已经真正掌握了该语言”的观点。当研究人员检查模型在答案中实际使用的语言时,结果非常鲜明。

  • 多语言训练: 当使用混合语言进行训练时,模型在非思考模式下回答韩语的比例为 90.5%,回答日语的比例为 90.9%
  • 仅限英语训练: 当仅使用英语进行训练时,模型的“韩语”回答比例下降到 48.3%(意味着它有一半时间在用英语回答),其“日语”回答比例骤降至 29.6%

即使在“思考模式”(即模型在回答前进行隐藏推理步骤)下,这一趋势依然存在。仅限英语训练的模型虽然能正确解决数学问题,但往往会用英语书写最终答案,忽略了问题是用韩语或日语提出的事实。论文得出结论:虽然仅限英语的训练可以转移推理能力,但它无法保持对目标语言进行响应的习惯。要让模型说出你想要的语言,你必须喂给它该语言的数据。

研究结果总结

论文证明了 OPD² 是一种更优越的方法,用于教授 AI 跨语言的数学推理,它持续优于原始的 OPD。它成功地缩小了英语与韩语、日语等语言之间的性能差距,表明多语言后训练是实现更平衡 AI 的可行路径。然而,这项研究也划出了一条清晰的界限,区分了“推理能力”与“语言生成”。虽然推理技能可以在一种语言中学习并应用到另一种语言,但除非模型经过目标语言数据的显式训练,否则它会自然地向英语偏移。作者建议,未来的研究应侧重于同时评估答案的准确性和响应的语言,以真正理解多语言 AI 的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →