← 最新论文
🤖 machine learning

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

本文提出了变换增强型 GRPO(TA-GRPO),该方法通过生成问题等价的改写形式来构建混合奖励与多样化的探索路径,从而缓解大语言模型推理中的梯度消失与多样性崩溃问题,进而在复杂数学基准测试中显著提升性能。

原作者: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位非常聪明的学生(一个大语言模型)如何解决复杂的数学问题。目前最佳的方法是称为GRPO的技术。将 GRPO 想象成一位老师,他要求学生针对同一个问题写下8 个不同的答案。随后,老师会对比这 8 个答案:如果有些正确而有些错误,学生就能学会哪种策略最有效。

然而,该论文指出,这种"8 个答案”的方法存在两个重大缺陷,就像学生可能掉入的两个陷阱:

  1. “全有或全无”陷阱(梯度消失):

    • 问题: 如果问题太简单,学生 8 个答案全对;如果太难,8 个答案全错。在这两种情况下,老师都无法告诉学生如何改进,因为答案之间没有差异。这就像老师说“干得好!”或“再试一次!”,却未解释为什么。学生得不到有用的反馈,学习便停滞不前。
    • 论文的解决方案: 老师不再仅仅重复问同一个问题 8 次,而是提出同一个问题,但用不同的方式重新表述(例如,改变词语顺序、使用不同的格式,或从不同角度讲述故事)。
    • 类比: 想象你问朋友"2+2 等于几?”,他们回答"4"。这很简单。现在问:“如果你有两个苹果,又得到两个,你总共有几个?”他们可能会说"4"。再问:“我有两双鞋,那总共有几只鞋?”他们可能会停顿并更努力地思考。尽管数学本质相同,但提问的方式改变了学生的思考过程。通过将原始问题与这些“重述的邻居”混合,学生更有可能在整个群体中获得正确与错误答案的混合,从而为老师提供大量有用的反馈。
  2. “回声室”陷阱(多样性崩溃):

    • 问题: 即使学生得到了一些正确答案和一些错误答案,他们往往倾向于对所有 8 个答案使用相同的推理模式。这就像学生只有一种“最爱”的解题方式,并拒绝尝试其他任何方法。他们停止探索新的策略。
    • 论文的解决方案: 由于重述后的问题看起来不同,学生被迫尝试不同的策略来解决它们。问题的一个版本可能触发“公式”方法,而另一个版本则触发“视觉”方法。
    • 类比: 这就像让厨师做汉堡。如果你只说“做一个汉堡”,他们每次可能都会做出完全一样的汉堡。但如果你说“把面包放在下面做一个汉堡”、“把肉切成块做一个汉堡”以及“先把奶酪融化做一个汉堡”,厨师就必须尝试不同的技巧。这迫使厨师探索更广泛的烹饪风格,从而使其整体成为更出色、更多才多艺的厨师。

新方法(TA-GRPO)如何运作

作者将他们的新方法称为TA-GRPO(变换增强型 GRPO)。以下是简单的步骤:

  1. 选取一道数学题。
  2. 使用 AI 工具(如 GPT-4)以不同的方式将该题目重写 3 次,同时保持原意不变。
  3. 要求学生解决原始问题以及3 个新版本,为这 4 个版本中的每一个生成 8 个答案。总计 32 个答案!
  4. 老师综合审视所有 32 个答案,以确定哪些策略最有效。
  5. 关键在于,尽管学生解决了问题的不同版本,但老师是根据原始问题来更新学生的“大脑”。这确保学生学到的是核心概念,而不仅仅是如何回答特定的措辞。

结果

该论文在四个不同规模的 AI 模型(从小型到中型)上,使用高难度数学竞赛(如 AMC 和 AIME)测试了此方法。

  • 更高的分数: TA-GRPO 的得分始终高于标准方法。例如,在最难的数学测试中,其成功率平均提高了约 5 个百分点。
  • 更智能的探索: 这些模型并非仅仅靠运气;它们实际上尝试了更多样化的解题方式。
  • 数据效率: 最令人印象深刻的发现是,TA-GRPO 所取得的效果相当于在2.5 倍更多数据上训练模型。换句话说,通过更聪明地提问,模型学到的知识相当于你喂给它额外的大量教科书。

代价

论文指出了一个小成本:为了获得这些重述的问题,你需要支付少量费用,使用强大的 AI(GPT-4-Turbo)进行重写。此外,由于模型在每个步骤中需要处理更多问题,训练时间也会稍长一些。但作者认为,性能的提升值得付出这些额外努力。

简而言之: TA-GRPO 通过让 AI 模型以许多不同的“伪装”回答同一个问题,防止它们感到无聊或陷入停滞。这迫使它们更具创造性地思考并更有效地学习,与单纯向问题堆砌更多数据相比,节省了时间和金钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →