这篇论文提出了一种名为 SKPO(Skip-Connected Policy Optimization,跳连策略优化)的新方法,旨在让大语言模型(LLM)在解决数学、代码等复杂推理任务时变得更聪明、更稳定。
为了让你轻松理解,我们可以把训练一个 AI 模型解决难题的过程,想象成教一个学生参加一场高难度的数学竞赛。
1. 之前的困境:为什么“细粒度”奖励行不通?
在传统的训练方法(如 GRPO)中,老师(奖励机制)通常只在学生做完整道题并给出最终答案后,才给一个分数(对或错)。
- 优点:简单、稳定。
- 缺点:学生不知道中间哪一步走错了,只知道最后没做对。
于是,研究人员想:“能不能在学生每写一步的时候都给反馈呢?”(这就是“细粒度奖励”)。
- 理想情况:老师看着学生写第一步,说“好”;写第二步,说“不好,重来”。这样学生进步最快。
- 现实情况(论文发现的痛点):
在 AI 的世界里,要判断“第一步”写得好不好,老师必须让学生基于这一步,反复尝试写出后续的所有可能答案(比如尝试 8 次、100 次),看看哪次能算对。
- 比喻:就像学生刚写下“设 x=...",老师就要让他基于这个开头,在脑子里模拟 100 种不同的解题路径,看看有多少种能算出正确答案。
- 问题:在资源有限(只能试几次)的情况下,这种模拟充满了噪音。有时候学生第一步其实写对了,但因为运气不好,模拟出来的后续路径都错了,老师就误以为第一步是错的。这种“误判”比直接等最后给分还要糟糕,导致学生越学越糊涂。
2. SKPO 的解决方案:把解题过程切成“两段”
SKPO 的核心思想是:不要试图在每一步都进行昂贵的模拟,而是把解题过程切成“上游”和“下游”两段,用不同的策略对待。
第一阶段:上游(Upstream)—— “先写个开头,别管对错”
- 做法:模型先写一段解题的开头(比如前 1/6 到 1/2 的内容),然后停下来。
- 奖励机制:这时候,模型不需要基于这个开头去模拟 100 次。它只需要写一次,然后把这个开头交给“下游”去处理。
- 比喻:就像学生先写个解题思路的大纲。老师不直接给大纲打分,而是说:“先别管对错,你先把这个大纲写出来,我们看看基于这个大纲,能不能解出答案。”
- 技术细节:这里使用了一种叫“单流优化”的方法,避免了因为样本太少而产生的误判。
第二阶段:下游(Downstream)—— “基于开头,疯狂试错”
- 做法:模型拿到那个“开头”,然后基于它,同时生成 8 种不同的完整解题过程(就像让 8 个分身同时做题)。
- 奖励机制:
- 看结果:这 8 个分身里,有几个做对了?如果大部分做对了,说明刚才那个“开头”是好的。
- 跳连(Skip Connection):这是 SKPO 最巧妙的地方。在生成这 8 个完整答案时,模型既看到了“开头”,也保留了“原题”。
- 比喻:这就像老师对学生说:“你可以参考刚才那个大纲(上游),但如果发现大纲走不通,你可以随时扔掉大纲,直接重新看原题,自己重新想。”
- 作用:这给了模型自由。如果上游的开头是错的,模型不会死脑筋地跟着错下去,它可以“跳过”错误的开头,直接回到原题重新思考。这既利用了上游的提示,又防止了被错误的开头带偏。
3. 为什么这样更好?(核心优势)
- 省资源:以前为了判断每一步,需要疯狂模拟;现在只需要在中间切一刀,模拟一次就够了。就像只试一次“开头 + 结尾”的组合,而不是每一步都试。
- 更聪明(隐式优势):
- 论文发现,用 SKPO 训练出来的模型,即使最后答案是对的,它中间思考的步骤质量也更高。
- 比喻:两个学生都解出了答案。
- 普通方法的学生:可能是蒙对的,中间步骤乱七八糟。
- SKPO 的学生:中间步骤逻辑清晰,即使最后答案一样,他的解题过程更稳健,更像真正的“推理”。
- 通用性强:不仅在数学题上有效,在写代码、通用逻辑推理上也能提升。
4. 总结:一个生动的场景
想象你在教一个机器人下棋:
- 旧方法(GRPO):机器人每走一步,你都不说话,直到它下完整个棋局,输了就扣分,赢了就加分。机器人不知道哪一步走错了。
- 笨办法(纯细粒度):机器人每走一步,你都要让它基于这一步,在脑海里模拟下完剩下的 100 种棋局,看看胜率。结果因为模拟次数不够,经常误判,把好棋当坏棋,把坏棋当好棋。
- SKPO 方法:
- 机器人先走前 10 步(上游)。
- 你让它基于这 10 步,快速模拟 8 种后续下法(下游)。
- 如果这 8 种下法里有很多能赢,说明前 10 步走得好,给奖励。
- 关键点:在模拟时,你告诉机器人:“你可以参考前 10 步,但如果发现不对劲,随时可以忽略前 10 步,重新看棋盘"。
- 这样,机器人既学会了利用好的开局,又学会了在开局不好时及时止损,最终下出了更高质量的棋局。
一句话总结:SKPO 通过巧妙拆分推理过程,用一种“既参考前文,又允许随时重来”的机制,解决了 AI 在精细奖励训练中容易“瞎猜”的问题,让模型在有限的算力下,学会了更高质量的推理逻辑。
这是一份关于论文《Skip-Connected Policy Optimization for Implicit Advantage》(用于隐式优势的跳连策略优化,简称 SKPO)的详细技术总结。
1. 研究背景与核心问题 (Problem)
在基于可验证奖励的强化学习(RLVR)中,组相对策略优化(GRPO) 因其利用结果导向奖励(Outcome-based rewards)和组内相对优势计算而表现出色。然而,现有的研究试图引入细粒度的密集奖励(Fine-grained dense rewards) 以提升性能上限,但在实际采样预算下遇到了严重瓶颈:
- 蒙特卡洛估计的高方差与符号不一致性:论文指出,在有限的采样预算(如 K=8)下,使用蒙特卡洛(MC)方法对推理过程中的早期 Token 进行步级奖励估计,会产生高方差的优势值(Advantages)。
- 早期 Token 的估计失效:由于早期推理步骤的不确定性极高,MC 估计的优势值符号(正/负)经常发生翻转(Sign Errors),导致优化方向错误。
- 性能悖论:这种高方差的细粒度奖励不仅未能提升性能,反而导致模型表现低于仅使用最终结果奖励的 GRPO 基线。
- 现有方法的困境:现有的多阶段方法(如反思、集成)牺牲了细粒度信息;而基于算法的细粒度奖励方法要么等价于粗粒度,要么需要 prohibitive(难以承受)的采样成本。
核心挑战:如何在有限的推理预算下,既获得细粒度的密集奖励信号,又保持策略优化的稳定性,避免早期 Token 的估计噪声破坏训练。
2. 方法论:SKPO (Methodology)
为了解决上述困境,作者提出了 Skip-Connected Policy Optimization (SKPO)。该方法将推理过程分解为**上游(Upstream)和下游(Downstream)**两个阶段,并通过独特的架构设计平衡了细粒度奖励与计算效率。
2.1 核心架构:上游 - 下游分解
- 上游阶段 (Upstream Phase):
- 模型生成一个早期停止的推理片段 s。
- 奖励来源:该片段接收来自下游采样的蒙特卡洛聚合奖励。
- 优化策略:由于每个提示词(Prompt)只生成一个上游片段,无法进行组相对估计。因此,采用 单流策略优化(Single-stream Policy Optimization, SPO),利用时间基线(Temporal Baseline,即基于历史样本的指数移动平均)来估计优势,避免了组内比较带来的符号噪声。
- 下游阶段 (Downstream Phase):
- 基于上游片段 s 和原始问题 q 的拼接进行采样。
- 关键创新:跳连(Skip Connection)[s, q]:下游的输入是
[s, q],即“上游片段 + 原始问题”。
- 作用 1(利用上游):保留了上游推理片段对后续生成的影响,使得上游片段能获得基于下游结果的密集奖励。
- 作用 2(保留探索自由):通过直接包含原始问题 q,模型拥有“跳过”或“修正”上游错误推理的捷径(Shortcut),防止上游的错误推理完全锁定下游的探索空间。
- 优化策略:下游生成 G 个完整响应,采用标准的 GRPO 进行组相对优化。
2.2 工程优化:单次通过(Single-Pass)
- 挑战: naive 的实现需要先生成上游片段,再基于它生成下游,导致两次 GPU 批次(Batch)调度,增加延迟。
- 解决方案:修改 vLLM 推理引擎,在单次 Rollout 过程中进行 KV Cache 重写。
- 并行生成 G 个响应,在预定的分割点 tq 暂停。
- 选择负对数似然(NLL)中位数的片段作为共享前缀 s。
- 重定向所有 G 个序列的 KV Cache 指针指向选定的 s,并重新计算
[s, q] 的 KV Cache。
- 效果:在单次 GPU 批次内完成上游和下游采样,计算成本与标准 GRPO 持平。
2.3 非对称优化策略 (Asymmetric Optimization)
- 上游:使用 SPO(单流 + 时间基线),解决样本不足导致的估计不稳定问题。
- 下游:使用 GRPO(组相对 + 截断重要性采样),利用充足的样本(G=8)获得稳定的优势估计。
3. 主要贡献 (Key Contributions)
- 理论发现:揭示了在实用采样预算下,细粒度蒙特卡洛奖励为何失败——早期 Token 的优势估计存在高方差和符号翻转,导致性能低于仅使用结果奖励的 GRPO。
- 算法创新 (SKPO):
- 提出了一种将推理分解为上游和下游的架构。
- 设计了 [s, q] 跳连机制,既让上游获得密集奖励,又允许下游绕过错误推理,平衡了引导与探索。
- 结合了单流优化(上游)和组相对优化(下游),解决了不同阶段样本效率不匹配的问题。
- 工程实现:通过 KV Cache 重写技术,实现了与 GRPO 相同的计算效率,无需额外的推理开销。
- 隐式优势发现:分析表明,SKPO 生成的轨迹即使在最终结果正确率相同的情况下,其中间步骤的质量(Intermediate-step quality)也显著更高,这是一种由优化结构涌现的“隐式优势”。
4. 实验结果 (Results)
实验在数学推理基准(In-Domain)和跨领域任务(Out-of-Domain)上进行了广泛评估,基座模型包括 Qwen2.5-Math-7B 和 Llama-3.2-3B。
- 数学基准表现 (In-Domain):
- 在 Qwen2.5-Math-7B 上,SKPO 平均得分 42.5%,超越了第二好的 CISPO (40.9%) 和 GRPO (30.2%)。
- 在 Llama-3.2-3B 上,SKPO 平均得分 24.1%,优于 DAPO (22.7%) 和 GRPO (18.9%)。
- 在 AIME、AMC、MATH 等具体数据集上均取得了 SOTA 或接近 SOTA 的成绩。
- 跨领域泛化 (Out-of-Domain):
- 在 MMLU-Pro(通用推理)和 LiveCodeBench(代码生成)上,SKPO 同样保持了显著优势,证明了其层级推理结构不仅限于数学,还能泛化到代码和通用推理任务。
- 消融实验 (Ablation Study):
- w/o Skip:移除跳连(仅用 s 作为前缀)导致性能大幅下降,验证了保留原始问题 q 以维持下游探索自由的重要性。
- w/o MC Estimation:上游不使用下游聚合奖励,导致无法学习促进下游解决的推理模式。
- Split@Fixed:固定分割点不如自适应采样有效。
- Selection:使用中位数选择上游片段优于选择极端(最小/最大困惑度)的片段。
- 隐式优势分析:
- 使用外部模型(GPT-5-nano)进行蒙特卡洛评估发现,SKPO 在推理的 20%-50% 阶段(问题设定与初步规划阶段)具有显著更高的相对优势,表明其生成的中间步骤质量更高。
5. 意义与影响 (Significance)
- 打破细粒度奖励的僵局:SKPO 提供了一种结构化的解决方案,使得在有限算力下利用细粒度奖励成为可能,而无需付出巨大的采样成本或牺牲稳定性。
- 提升推理质量:实验证明,SKPO 不仅提高了最终答案的正确率,更重要的是提升了推理过程的质量。模型学会了生成更稳健的中间步骤,这对于复杂任务(如数学证明、代码生成)至关重要。
- 高效性:通过工程优化,SKPO 在保持与 GRPO 相同训练成本的同时,实现了性能的大幅跃升,具有极高的实用价值。
- 对 RLVR 的启示:该工作表明,简单的“更细粒度”并不总是更好,关键在于如何设计架构来管理估计噪声,并利用“跳连”等机制平衡引导与探索。
总结:SKPO 通过巧妙的架构设计(上游/下游分解 + 跳连)和工程优化,成功解决了细粒度奖励在 RLVR 中的不稳定性问题,显著提升了大模型在数学、代码及通用推理任务上的表现,并揭示了优化结构对中间推理质量的隐式提升作用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。