想象一下,你正在教一位非常聪明的学生(一个大语言模型)如何解决复杂的数学问题。目前最佳的方法是称为GRPO的技术。将 GRPO 想象成一位老师,他要求学生针对同一个问题写下8 个不同的答案。随后,老师会对比这 8 个答案:如果有些正确而有些错误,学生就能学会哪种策略最有效。
然而,该论文指出,这种"8 个答案”的方法存在两个重大缺陷,就像学生可能掉入的两个陷阱:
“全有或全无”陷阱(梯度消失):
- 问题: 如果问题太简单,学生 8 个答案全对;如果太难,8 个答案全错。在这两种情况下,老师都无法告诉学生如何改进,因为答案之间没有差异。这就像老师说“干得好!”或“再试一次!”,却未解释为什么。学生得不到有用的反馈,学习便停滞不前。
- 论文的解决方案: 老师不再仅仅重复问同一个问题 8 次,而是提出同一个问题,但用不同的方式重新表述(例如,改变词语顺序、使用不同的格式,或从不同角度讲述故事)。
- 类比: 想象你问朋友"2+2 等于几?”,他们回答"4"。这很简单。现在问:“如果你有两个苹果,又得到两个,你总共有几个?”他们可能会说"4"。再问:“我有两双鞋,那总共有几只鞋?”他们可能会停顿并更努力地思考。尽管数学本质相同,但提问的方式改变了学生的思考过程。通过将原始问题与这些“重述的邻居”混合,学生更有可能在整个群体中获得正确与错误答案的混合,从而为老师提供大量有用的反馈。
“回声室”陷阱(多样性崩溃):
- 问题: 即使学生得到了一些正确答案和一些错误答案,他们往往倾向于对所有 8 个答案使用相同的推理模式。这就像学生只有一种“最爱”的解题方式,并拒绝尝试其他任何方法。他们停止探索新的策略。
- 论文的解决方案: 由于重述后的问题看起来不同,学生被迫尝试不同的策略来解决它们。问题的一个版本可能触发“公式”方法,而另一个版本则触发“视觉”方法。
- 类比: 这就像让厨师做汉堡。如果你只说“做一个汉堡”,他们每次可能都会做出完全一样的汉堡。但如果你说“把面包放在下面做一个汉堡”、“把肉切成块做一个汉堡”以及“先把奶酪融化做一个汉堡”,厨师就必须尝试不同的技巧。这迫使厨师探索更广泛的烹饪风格,从而使其整体成为更出色、更多才多艺的厨师。
新方法(TA-GRPO)如何运作
作者将他们的新方法称为TA-GRPO(变换增强型 GRPO)。以下是简单的步骤:
- 选取一道数学题。
- 使用 AI 工具(如 GPT-4)以不同的方式将该题目重写 3 次,同时保持原意不变。
- 要求学生解决原始问题以及3 个新版本,为这 4 个版本中的每一个生成 8 个答案。总计 32 个答案!
- 老师综合审视所有 32 个答案,以确定哪些策略最有效。
- 关键在于,尽管学生解决了问题的不同版本,但老师是根据原始问题来更新学生的“大脑”。这确保学生学到的是核心概念,而不仅仅是如何回答特定的措辞。
结果
该论文在四个不同规模的 AI 模型(从小型到中型)上,使用高难度数学竞赛(如 AMC 和 AIME)测试了此方法。
- 更高的分数: TA-GRPO 的得分始终高于标准方法。例如,在最难的数学测试中,其成功率平均提高了约 5 个百分点。
- 更智能的探索: 这些模型并非仅仅靠运气;它们实际上尝试了更多样化的解题方式。
- 数据效率: 最令人印象深刻的发现是,TA-GRPO 所取得的效果相当于在2.5 倍更多数据上训练模型。换句话说,通过更聪明地提问,模型学到的知识相当于你喂给它额外的大量教科书。
代价
论文指出了一个小成本:为了获得这些重述的问题,你需要支付少量费用,使用强大的 AI(GPT-4-Turbo)进行重写。此外,由于模型在每个步骤中需要处理更多问题,训练时间也会稍长一些。但作者认为,性能的提升值得付出这些额外努力。
简而言之: TA-GRPO 通过让 AI 模型以许多不同的“伪装”回答同一个问题,防止它们感到无聊或陷入停滞。这迫使它们更具创造性地思考并更有效地学习,与单纯向问题堆砌更多数据相比,节省了时间和金钱。
技术摘要:变换增强型 GRPO(TA-GRPO)
问题陈述
组相对策略优化(GRPO)已成为大语言模型(LLMs)中基于可验证奖励的强化学习(RLVR)的主导方法,尤其适用于复杂推理任务。然而,该论文指出标准 GRPO 存在两个阻碍有效探索的关键结构性局限:
- 梯度消失:当训练问题被认为过于简单(所有采样回答均正确)或过于困难(所有回答均错误)时,G 个回答组将获得相同的奖励。因此,奖励的标准差为零,导致优势值为零,模型更新缺乏梯度信号。虽然动态采样(DAPO)试图通过丢弃此类问题来缓解这一问题,但这会导致显著的数据浪费。
- 多样性崩溃:模型倾向于在所有 G 个采样回答中收敛于单一的推理模式。由于大语言模型巨大的动作空间,经典的熵正则化无法阻止这一现象。一旦策略集中于狭窄的推理轨迹集合,采样分布便会继承这种集中性,且目标函数缺乏奖励扩大支持范围的机制,导致可探索的解空间单调收缩。
现有的 GRPO 进展往往零散地解决这些问题,或依赖丢弃数据,而非在优化框架内协同解决根本原因。
方法论:变换增强型 GRPO(TA-GRPO)
作者提出了 TA-GRPO,这是一种通过问题重述来解决梯度消失和多样性崩溃的策略优化方法。其核心洞察是:语言扰动(措辞、格式或信息顺序的变化)可以改变模型感知的难度,并诱导不同的解决策略,同时保留底层问题的语义。
TA-GRPO 流程对标准 GRPO 过程进行了如下修改:
- 问题变换:对于每个原始训练问题 q0,系统利用 GPT-4-Turbo 自动生成 N 个语义等价的重述 {qn}n=1N(称为“邻居”)。这些重述保留了底层含义,但改变了表面形式。
- 扩展回答组:模型不再仅针对 q0 采样 G 个回答,而是针对原始问题采样 G 个回答,并针对 N 个邻居中的每一个也采样 G 个回答。这形成了一个包含 (N+1)×G 个回答的扩展组。
- 联合优势计算:优势值通过对整个扩展集合(即 (N+1)×G 个回答)进行组相对归一化来计算,而不是对每个重述单独归一化。
- 缓解梯度消失:即使原始问题产生均匀的奖励,由于感知难度的偏移,重述后的邻居往往会产生混合奖励(部分正确,部分错误)。联合归一化确保标准差非零,从而保留梯度信号。
- 缓解多样性崩溃:多样化的重述在同一组内引发不同的推理模式,防止策略坍缩为单一模式。
- 锚定重要性比率:为了确保模型学会解决原始问题,所有重要性比率均以原始问题 q0 为条件,无论特定回答是由哪个重述(qn)生成的。这将重述视为 q0 的代理采样分布,其合理性基于问题等价重述会产生相似推理轨迹的假设。
目标函数在此扩展组上最大化截断的代理损失,其中优势值源自联合归一化,重要性比率则锚定于原始提示。
主要贡献
该论文概述了四项主要贡献:
- 识别被忽视的问题:指出梯度消失和多样性崩溃在很大程度上被现有的 GRPO 进展所忽视,后者通常分别处理这些问题或通过数据过滤来解决。
- TA-GRPO 算法:一种简单的扩展,通过聚合问题及其重述邻居的回答、计算联合优势并将更新锚定至原始问题,同时解决这两个问题。
- 实证有效性:大量实验表明,在竞赛级基准(AMC、OlympiadBench、AIME24/25)和分布外基准(Minerva、GPQA-Diamond)上,TA-GRPO 在四个大语言模型(Qwen3-1.7B/4B、Llama-3.2-1B/3B)上的 pass@k 指标均表现出一致的提升。
- 数据效率:TA-GRPO 在无需收集额外高质量训练数据的情况下,实现了与使用多达 2.5 倍 数据训练的基线相当的性能,提供了一种经济的数据扩展替代方案。
实验结果
作者使用 MATH 数据集(7,498 个问题)作为训练集评估了 TA-GRPO。
- 训练信号诊断:训练检查点的分析显示,随着训练的进行,标准 GRPO 日益遭受梯度消失(高达 93.2% 的问题产生均匀奖励)和多样性崩溃(嵌入距离集中)的影响,而 TA-GRPO 在整个训练过程中保持了稳定的混合奖励幅度和多样化的推理路径。
- 性能提升:
- 在竞赛级基准上,TA-GRPO 使 Qwen3-1.7B 和 Qwen3-4B 的平均 pass@32 分别提高了 5.09 和 5.01 分,使 Llama-3.2-1B 和 Llama-3.2-3B 分别提高了 3.50 和 5.25 分。
- 显著的峰值提升包括 AIME24 上的 +9.98(Qwen3-4B)和 GPQA-Diamond 上的 +8.58(Qwen3-1.7B)。
- 对照实验:
- 匹配采样:当与仅增加采样回答总数以匹配 TA-GRPO 预算(不进行重述)的基线相比时,TA-GRPO 仍保持了明显的优势(例如,Qwen3-4B 在 AIME24 上高出 +6.86)。这证实了增益源于采样空间的多样性和联合归一化,而不仅仅是样本数量。
- 数据扩展:在 1 倍数据上训练的 TA-GRPO 达到了在 2.5 倍数据上训练的 GRPO 基线的性能,证明了显著的数据效率。
意义与主张
该论文将 TA-GRPO 定位为一种改变 RL 后训练范式的方 法。虽然以往的工作侧重于优化损失函数或奖励轴,但 TA-GRPO 引入了输入分布作为增强探索的第三个杠杆。通过利用问题等价的重述,该方法使模型能够从更丰富的解决尝试集合中学习,而无需丢弃数据或依赖熵正则化。作者声称,这种方法为提升大语言模型的推理能力提供了一条稳健且数据高效的路径,特别是在数据收集成本高昂或标准 GRPO 无法提供足够梯度信号的场景中。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。