← 最新论文
💬 NLP

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

本文提出了一种利用语义奖励进行组相对策略优化(GRPO)的强化学习方法,将大语言模型扩展至低资源语言,在保留通用能力并提升语义质量的同时,有效缓解了监督微调通常引发的“对齐税”和灾难性遗忘问题。

原作者: Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对该论文的解读。

核心难题:“对齐税”

想象你有一位才华横溢、周游世界的厨师(即大型语言模型),他精通用英语、西班牙语和法语烹饪出令人惊叹的佳肴。但他从未做过藏语菜肴。

为了教会他藏语,旧方法(称为监督微调或 SFT)就像强迫厨师站在厨房里,逐字逐句地抄写一本食谱。厨师死记硬背每一种食材的准确拼写和每一步骤的精确顺序。

问题在于:由于这本藏语食谱很薄,而厨师又过于专注于完美地复制它,他开始忘记如何烹饪那些著名的法式菜肴。这就是论文中所称的“对齐税”。你获得了一项新技能(藏语),却失去了旧技能(英语/法语),因为训练过程过于僵化。

新方案:“语义空间”对齐

作者提出了一种不同的教学厨师的方法。他们不再强迫厨师逐字抄写页面上的文字,而是教他理解菜肴背后的含义

他们使用了一种名为基于语义奖励的强化学习的新方法。其运作原理如下:

  1. 目标:目标不是逐字匹配食谱书,而是做出一道味道与原菜相同的菜肴,即使食材列表不同,或者步骤描述方式独特。
  2. 评判者(奖励):不再由一位严苛的老师检查每一个字母,而是让厨师接受一位聪明的美食评论家(嵌入模型)的“品尝测试”。评论家会说:“这道菜捕捉到了原食谱的精髓",即使厨师使用了不同的词汇来描述它。
  3. 安全网:为了确保厨师不会意外地开始用法语烹饪或混合语言,有一条简单的规则:“你必须用藏文脚本书写食谱。”

他们是如何做到的(两阶段计划)

研究人员并没有直接跳入新方法,而是采用了一个两步流程:

  • 第一步:热身(冷启动):首先,他们给厨师提供了一点点旧式的逐字训练。这仅仅是教会厨师如何用藏文握笔并写出基本句子。这并不要求完美,只是为了让他们起步,不至于迷失方向。
  • 第二步:品尝测试(强化学习):一旦厨师能够书写,他们就切换到新方法。厨师尝试多种不同的方式书写食谱。每次他们正确把握了含义(根据聪明评论家的判断),就会获得奖励。如果含义错误或混合了语言,则没有奖励。

结果如何?(实验结果)

研究人员在藏语与中文互译以及藏语新闻标题写作任务上测试了这种方法。

  • 旧方法(SFT):厨师非常擅长逐字抄写藏语食谱。然而,他们忘记了很多法式烹饪技能(“税”很高)。
  • 新方法(语义强化学习)
    • 更好的记忆:厨师几乎完美地保留了他们的法式技能。他们没有忘记旧有的能力。
    • 更好的含义:尽管新厨师的藏语食谱与参考书在逐字匹配上不完全一致(较低的"n-gram 重叠”),但聪明的美食评论家(LLM 评判器)更偏爱新厨师的菜肴,因为它们更好地捕捉了真正的风味和含义。
    • 更灵活:新厨师学会了用多种不同的方式表达同一个想法,而不是仅仅局限于一种僵化的方式。

核心启示

该论文认为,在教 AI 学习一种稀有语言时,我们不应强迫它死记硬背字典。相反,我们应该奖励它对含义的理解。

通过关注“语义空间”(思想和意义的领域),而不是“词元级”(特定字母和单词的领域),我们可以教会 AI 新语言,而不会让它忘记已知的一切。这就像通过让人讲故事来教他们说一门新语言,而不是让他们背诵字典,从而确保他们在所有语言中都能成为优秀的讲故事者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →