想象一下,你正在教导一位才华横溢但略显困惑的学生如何解开一个复杂的迷宫。过去,我们训练这些 AI“学生”(大型语言模型)的方式,就像是给他们一场考试,然后只告知最终分数:“你答错了。”
这正是论文STRIDE试图解决的问题。以下是其工作原理的简明拆解,并辅以日常类比。
问题所在:“沉默”的成绩单
目前,大多数 AI 训练使用一种称为强化学习的方法。这就像玩电子游戏:AI 完成一个关卡,然后在最后收到“游戏结束”或“你赢了”的信息。
- 问题:如果 AI 在 10 步数学题的第 3 步出错,老师(计算机)不会说:“嘿,你在第 3 步加法算错了。”它只会说:“答案错误。”
- 结果:AI 必须猜测自己哪里出错了。这就像试图修理一辆无法启动的汽车,却只知道车坏了,而没有机械师告诉你哪个零件松了。这被称为信息瓶颈——老师提供的信息太少,无法修正具体错误。
一些先前的方法尝试提供逐步评分(如“第 1 步:好,第 2 步:坏”),但这些评分仅仅是数字(0 或 1)。它们仍然无法解释为什么该步骤是坏的。
解决方案:STRIDE(“健谈”的教练)
作者提出了STRIDE,其全称为Stepwise Trajectory Redirection with In-context Deep Evaluation(带上下文深度评估的逐步轨迹重定向)。
STRIDE 引入了一个生成式验证器,取代了沉默的成绩单。你可以把它想象成一位辅导助手,坐在学生旁边,实时与学生一起分析问题。
STRIDE 的工作分为三个阶段,就像一个训练营:
第一阶段:热身(基础策略)
AI 学生尝试独立解决问题。它在最后获得一个简单的“对/错”评分。这建立了基础,就像学习游戏规则一样。
第二阶段:训练教练(验证器)
现在,系统训练第二个 AI(验证器)充当教练。
- 神奇之处:教练并非由人类提供每一步的对错列表来训练(这既昂贵又缓慢)。相反,教练通过观察学生解题并检查最终答案是否正确来学习。
- 技能:随着时间的推移,教练学会审视学生杂乱无章的解题过程,并指出:“等等,在第 3 步,你忘了进位,”或者“你在这里跳过了一个逻辑步骤。”它学会将简单的“错误”评分转化为详细的书面评语。
第三阶段:带指导的“重做”(轨迹重定向)
这是核心创新。当学生解题失败时:
- 找出第一个错误:教练(验证器)扫描学生的解题过程,找到首个失败点(FPF)。它精确定位逻辑断裂的确切位置。
- “重定向”:系统不会让学生从头开始重做整个问题(这很浪费),而是说:“好吧,你在第 2 步之前做得很好。让我们停在那里。这是我关于第 3 步为何失败的书面说明。现在,请利用我的建议,从第 2 步开始,重新尝试解决剩余部分。”
- 多点策略:有时,第 3 步的错误实际上是由第 1 步的一个当时看起来不错的“糟糕选择”引起的。STRIDE 足够智能,会说:“让我们尝试从第 1 步和第 2 步重新开始”,给学生多次机会寻找更好的路径。
为什么这很重要
该论文声称,这种方法解决了两个主要问题:
- 打破“沉默”:通过使用语言反馈(文字)而不仅仅是标量奖励(数字),AI 获得了更丰富的解释。这就像老师只说“不及格”与老师说“你忘了分配负号”之间的区别。
- 解决“无解”问题:作者发现,对于 AI 通常正确率为 0% 的极难问题,标准方法会因为得不到任何有用信号而放弃。然而,STRIDE 仍然可以学习。即使 AI 失败了,教练也能指出错误,AI 可以从该特定点尝试不同的路径,最终破解难题。
类比总结
- 旧方法:你参加了一场考试。你得到了"0/100"。你不知道该复习什么。
- 之前的“逐步”方法:你得到了一份带有评分的试卷:“第 1 步:10/10,第 2 步:0/10"。你知道哪里失败了,但不知道为什么。
- STRIDE:你参加了一场考试。你得到了"0/100",但老师还递给你一张书面便条,上面写着:“你在第 2 步卡住了,因为你用错了公式。让我们回到第 1 步,看看这张便条,尝试一种不同的方法。”
结果
该论文在困难的数学和逻辑谜题上测试了这种方法。
- STRIDE 击败了所有其他现有方法(包括之前的最先进方法)。
- 它在数学问题、编程挑战和逻辑谜题上都有效。
- 最重要的是,它成功解决了以前被认为对这些模型“不可能”解决的问题,将 0% 的成功率转化为学习机会。
简而言之,STRIDE 教导 AI 通过与自己对话来从错误中学习,而不是盲目猜测。
技术摘要:STRIDE——用于大语言模型推理的可学习分步语言反馈
1. 问题陈述
大语言模型(LLM)推理领域的近期进展主要由基于可验证奖励的强化学习(RLVR)推动。然而,现有方法面临两个关键局限:
- 标量奖励的信息瓶颈:过程奖励模型(PRMs)试图提供步骤级监督,但依赖于标量分数。将高维推理路径压缩为单一数值,造成了信息瓶颈,导致语义上截然不同的错误模式(例如算术错误与逻辑跳跃)坍缩为相同的分数,缺乏足够的语义带宽来指导修正。
- 现有语言反馈的局限性:虽然基于批判的方法提供了更丰富的文本反馈,但它们通常依赖冻结的或外部的批判器,限制了可扩展性和适应性。此外,近期使用生成式验证器的协同训练框架(例如 TANGO)往往将语言输出重新转换为标量奖励,从而重新引入了相同的信息瓶颈。
- 信用分配:基于结果的强化学习无法提供关于单个推理步骤的反馈,导致在多步推理中,“信用分配”问题(即识别哪些具体步骤导致了成功或失败)在很大程度上仍未解决。
2. 方法论:STRIDE 框架
STRIDE(可学习分步语言反馈)提出了一种从标量过程监督向可学习的、分步语言反馈的范式转变。它采用交错式的三阶段训练计划,涉及生成器(Gθ)和生成式验证器(Vϕ),仅使用基于结果的奖励(无需步骤级标注)进行联合训练。
核心组件
- 生成器 - 验证器协同训练:两个模型均通过组相对策略优化(GRPO)进行优化,仅使用最终结果的准确性(c∗)。验证器学习将终端奖励分解为步骤级的语言批判(vt),而无需显式的步骤级标签。
- 阶段 I:基础策略优化:生成器在结果奖励上进行训练,以构建基础推理能力。此阶段占据训练计划的大部分时间(9/13)。
- 阶段 II:生成式验证器优化:验证器被训练为针对每个推理步骤生成高保真的语言批判(v=(v1,...,vT))。它学习定位错误并用语言进行解释,有效地充当“上下文导航器”。
- 阶段 III:引导轨迹重定向:这是核心创新。当生成器失败时,验证器识别首个失败点(FPF),记为 t∗。STRIDE 不从头开始,而是采用多点重定向策略:
- 锚点:它从所有前缀步骤 t∈[1,t∗] 构建重定向样本,而不仅仅局限于 FPF。
- 指令:
- 修正提示(t=t∗):指示生成器修正由验证器识别出的特定逻辑谬误。
- 探索提示(t<t∗):指示生成器从已验证的前缀继续推理,鼓励发现替代的、更稳健的路径(解决“潜在漂移”问题,即早期的次优选择导致后期的失败)。
- 训练稳定性:关键在于,阶段 III 中的优势函数严格基于重定向轨迹的最终结果准确性计算。这确保了即使验证器的语言反馈存在噪声或幻觉,策略更新仍基于可验证的结果,从而防止有害的梯度噪声。
3. 主要贡献
- 向高带宽反馈的范式转变:本文提出将过程监督从一维标量奖励转变为可学习的、上下文内的语言反馈。这解锁了更丰富的训练信号,能够区分定性上不同的错误模式。
- STRIDE 框架:一种集成了多点重定向策略的交错式三阶段协同训练计划。它利用已验证的语义锚点高效地约束推理探索空间,使模型能够从以前无法解决的问题中学习。
- 对验证器噪声的鲁棒性:通过将学习信号严格锚定在结果准确性上,STRIDE 确保了“无害的策略改进”。即使验证器的定位不完美,该框架也能保证非负改进,因为只有成功的重定向才会贡献于策略更新。
4. 实验结果
实验在多样化的基准测试上进行,包括数学推理(MATH-500、AIME 2024/2025、AMC 2023、OlympiadBench)和域外推理(BoardgameQA、CRUXEval、StrategyQA、TableBench)。
- 性能:STRIDE 显著优于最先进(SOTA)的基线,包括原生基于结果的强化学习(GRPO)和标量奖励协同训练框架 TANGO。
- 在 Qwen2.5-7B 上,STRIDE 在 MATH-500 上取得了 84.6 的分数,而 TANGO 为 81.4,GRPO 为 74.6。
- 在 Llama-3.1-8B 上,STRIDE 在 MATH-500 上取得了 70.4 的分数,优于 TANGO(69.2)和 GRPO(66.8)。
- 在逻辑、代码、常识和表格推理任务中均取得了稳定的提升,表明其泛化能力超越了数学领域。
- 零通过率问题:在消融研究中,STRIDE 在所有标量奖励基线均产生零梯度信号的问题上(即模型最初无法解决的问题),实现了 6.8% 的修正成功率(CSR)。这证明了该框架将不可解实例转化为有效学习信号的能力。
- 训练动态:
- 验证器质量:验证器的步骤级定位准确性和批判有用性在训练过程中稳步提升,证实了结果级监督足以发展出可靠的过程级能力。
- 探索:STRIDE 保持了比标量奖励基线更高且一致的策略熵,防止了过早收敛和表征坍缩。
- 推理深度:重定向阶段促进了更深层次、结构更复杂的推理链的涌现,这是独立采样无法产生的。
5. 意义与主张
本文主张 STRIDE 解决了标量奖励系统固有的根本性表征坍缩问题。通过利用可学习的分步语言反馈,该框架提供了必要的语义方向,以定位和修正特定的推理错误。
作者强调,STRIDE 的有效性源于监督的范式转变,而非计算预算的增加。与计算量匹配的基线(增加训练步数或批量大小)相比,STRIDE 的性能飞跃带来的收益微乎其微。此外,该框架表明,即使来自不完美的验证器,高带宽的语言指导也能产生益处,从而缓解了人们对学习到的批判器可靠性的担忧。这项工作表明,从标量转向基于语言的过程监督是克服大语言模型推理瓶颈的一条可行路径,能够实现引导式自我修正,而非穷举采样。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。