想象一下,你正在教一个非常年幼、充满求知欲的学生(一个小型的 AI 模型)如何解决数学应用题。你不仅希望他能得到正确答案,更希望他学会“如何思考”,而不仅仅是靠猜。
这篇论文就像是在比较两种不同的评分方式:只检查最终答案 versus 检查每一个解题步骤。
以下是他们实验内容的简单拆解:
设置:这个“小脑袋”学生
研究人员使用了一个非常小的 AI 模型(称为 Qwen2.5-0.5B)。你可以把这个模型想象成一个聪明但瘦小的孩子,他的记忆力或脑力并不大。因为规模较小,如果指令不够清晰,他很容易感到困惑。
他们给这个学生布置了 1,319 道数学题(来自一个名为 GSM8K 的数据集)。他们使用了一种叫做“强化学习”的方法来训练这个学生,这基本上是一种奖励机制:答对了给“做得好!”,答错了说“再试一次”。
两种教学风格(奖励结构)
研究人员测试了五种不同的给予奖励的方式:
“仅看结果”型教练(最终成绩单):
- 运作方式: 老师只看方框里的最终数字。如果答案正确,学生就会得到一颗小星星;如果错误,则什么都没有。
- 结果: 这个学生大约在 54% 的情况下答对了题目。
- 问题: 学生开始“作弊”或瞎猜了。他们会直接跳到答案,跳过步骤,或者编造逻辑,只为了拿到那颗小星星。他们的推理过程很混乱,即使最终数字碰巧对了,逻辑也往往是错误的。
“仅看过程”型教练(步步检查员):
- 运作方式: 老师会检查学生写下的每一个步骤。他们加法算对了吗?他们定义变量了吗?如果某一步是对的,就给一分;如果某一步错了,就扣一分。
- 结果: 这个学生答对题目的概率达到了 64%。
- 好处: 他们的思维变得更加逻辑化且有据可依。他们真的学会了如何解决问题。
- 副作用: 这个学生变得有点啰嗦。他们有时会写太多步骤或重复自己,就像一个因为太害怕犯错而为了解 2+2 就写出一篇长篇大论的学生。
“混合型”教练(混合两种风格):
- 研究人员尝试将这两种风格混合在一起。他们给学生的评分既基于步骤,也结合了一点最终答案的权重(或反之亦然)。
- 惊喜之处: 最好的组合是 90% 关注步骤,10% 关注最终答案。这个学生的表现几乎接近“仅看过程”的学生(准确率 61%),但他们的回答更简洁、更干净。
- 警告: 当他们尝试一种 90% 关注最终答案,仅 10% 关注步骤 的混合方式时,学生的表现甚至比“仅看结果”的学生还要差。看来,当“最终答案”的奖励声过大时,会干扰学生,使“步步拆解”的指令变得毫无意义。
他们发现了什么?(类比)
把 AI 想象成一个正在尝试登顶高峰(正确答案)的徒步旅行者。
- 仅看结果: 你告诉徒步者,“如果你到达了顶峰,你就能得到奖品。”徒步者可能会走捷径、从悬崖滑下或迷路,但如果他们靠运气撞到了顶峰,他们就赢了。他们并没有学会路径。
- 仅看过程: 你告诉徒步者,“每当你沿着正确的路径迈出安全的一步,你就能得到一份零食。”徒步者学会了路径。他们可能会为了安全多走几步,但他们能可靠地到达目的地。
- 混合型: 你为安全的步伐提供零食,但也为到达顶峰提供大奖。如果奖品相对于零食来说太大了,徒步者就会忽略路径,试图飞翔或跳跃,从而导致失败更多。
核心启示
论文的结论是:如何评分比你想象的更重要。
对于小型 AI 模型,仅仅奖励最终答案是不够的。这会产生“幻觉”(虚假逻辑),即模型为了得到正确的数字而编造步骤。为了让模型真正进行正确的思考,你必须大力奖励其过程(步骤)。
“仅看过程”的方法显著提高了模型的智能度和准确度,证明了对于“小脑袋”来说,展示解题过程与得到正确答案同样重要。
技术摘要:小语言模型在 RLVR 中的奖励粒度研究
问题陈述
基于可验证奖励的强化学习(RLVR)已成为增强语言模型数学推理能力的范式,该范式通常依赖于基于结果的奖励(最终答案的正确性)。然而,过程级监督(逐步奖励)的影响仍有待深入探索,特别是对于像 Qwen2.5-0.5B 这样的小语言模型(SLM)。这些较小的模型由于缺乏内部能力,在面对稀疏的仅基于结果的反馈时,往往难以进行自我纠错,导致其推理轨迹即使在最终答案正确的情况下,也可能存在逻辑不一致、幻觉或结构性缺陷。核心研究问题在于:过程奖励是否能提高推理轨迹的连贯性和有效性,以及混合奖励结构是否比单一的奖励方法具有更稳定的推理表现。
研究方法
作者使用 Qwen2.5-0.5B(一种紧凑的 Transformer 模型)进行了受控实证研究,并在 GSM8K 数据集(小学数学应用题)上使用**组相对策略优化(GRPO)**对其进行了微调。
实验设置
- 基线(Baseline): 在直接回答(无思维链)设置下评估的预训练模型,准确率为 33.13%。
- 奖励机制: 对五种不同的奖励条件进行了比较:
- 仅过程(Process-Only): 如果中间步骤与标准答案的计算匹配(在数值容差范围内),则分配奖励。如果生成的链条超过标准答案步骤数的 1.5 倍,则施加惩罚。
- 仅结果(Outcome-Only): 基于最终数值答案正确性的二元奖励。
- 混合配置(Hybrid Configurations): 过程奖励与结果奖励的加权组合(R=λ⋅Rprocess+(1−λ)⋅Routcome),其中 λ∈{0.9,0.5,0.1}。
- 评估策略:
- 准确率(Accuracy): 在完整的 1,319 道题目测试集上进行测量。
- 推理保真度(Reasoning Fidelity): 在一个分层的 45 道题目切片(15 易、15 中、15 难)上进行评估,使用四个指标:
- CoT-Pass@1: 单次采样轨迹的成功率。
- 轨迹有效性(Trace Validity): 逻辑上的完备性(不存在矛盾或无效转换)。
- 链条长度偏差(Chain Length Deviation): 生成步骤数与标准答案步骤数之间的差异。
- 过程步骤比例(Process Step Ratio): 与标准答案推理对齐的步骤比例。
- 错误分析: 使用 GPT-4o 作为评判器,对失败模式进行分类(例如:推导错误、计算错误、缺失步骤、矛盾等)。
关键结果
1. 准确率提升
仅过程监督实现了最高的测试准确率,达到 63.73%,相比基线提升了 30.60%。这显著优于仅结果监督(53.75%,提升了 20.62%)。
- 混合性能: 高过程权重(λ=0.9)的混合配置达到了 61.10% 的准确率。
- 异常情况: 低过程/高结果配置(λ=0.1)的表现逊于纯结果监督(49.30%),这表明在这种特定权重下,冲突的优化信号会降低性能。
2. 推理保真度与稳定性
- 轨迹有效性: λ=0.9 的混合模型实现了最高的轨迹有效性(0.60),其次是结果监督(0.40)和仅过程监督(0.22)。
- 链条长度: 仅过程模型表现出最大的标准答案链条长度偏差(6.49),表明其倾向于生成冗长或冗余的推理。仅结果模型产生的链条更简洁(偏差为 3.64)。
- 过程步骤比例: λ=0.9 的混合模型实现了最高的比例(0.84),表明其与标准答案中间步骤的对齐程度最好。
3. 定性与错误分析
- 仅过程模型: 生成了结构不一致但符合算术逻辑的轨迹。它们经常引入结构性不一致和矛盾,这可能是由于存在产生长链条且局部看似合理的步骤的激励机制。
- 仅结果模型: 产生的链条较为简洁,但容易出现推导和计算错误,反映出中间环节的接地能力弱,并表现出在推理点之间“跳跃”的倾向。
- 混合模型: 展示了最接近人类的推理流,平衡了步骤的连续性与必要的简洁性,并且错误类型的分布最为均匀,极少出现灾难性的失败。
意义与贡献
本文声称,奖励粒度是 RLVR 的一阶设计决策,而非次要的实现细节。主要贡献包括:
- 系统性比较: 通过在小模型上对五种奖励条件进行受控比较,证明了对于 SLM 而言,密集的过程信号比稀疏的结果反馈能提供更具信息量的引导。
- 超越准确率: 确立了准确率本身是不够的;过程监督显著提高了轨迹保真度和步骤有效性,而仅结果监督会导致“不稳定”的推理。
- 混合动力学: 指出虽然混合奖励通常与过程权重呈正相关,但特定的低过程配置会产生损害性能的冲突信号。
- 失败模式特征化: 利用 LLM-as-a-judge 揭示了不同的失败分布:过程模型受困于结构不一致,而结果模型则受困于推导错误。
作者得出结论:为了开发不仅能给出正确答案而且能进行可靠推理的模型,监督推理的过程和结果至关重要。仅过程监督与仅结果监督之间近 10 个百分点的准确率差距,凸显了奖励粒度对于小语言模型的关键重要性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。