← 最新论文
🤖 machine learning

Skip-Connected Policy Optimization for Implicit Advantage

该论文提出了一种名为 SKPO 的新方法,通过引入跳连机制将推理过程分解为上游和下游阶段,有效解决了在有限采样预算下蒙特卡洛估计导致早期推理令牌优势信号高方差的问题,从而在数学、通用推理及代码生成等任务中显著超越了现有基线模型。

原作者: Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo

发布于 2026-04-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 SKPO(Skip-Connected Policy Optimization,跳连策略优化)的新方法,旨在让大语言模型(LLM)在解决数学、代码等复杂推理任务时变得更聪明、更稳定。

为了让你轻松理解,我们可以把训练一个 AI 模型解决难题的过程,想象成教一个学生参加一场高难度的数学竞赛

1. 之前的困境:为什么“细粒度”奖励行不通?

在传统的训练方法(如 GRPO)中,老师(奖励机制)通常只在学生做完整道题并给出最终答案后,才给一个分数(对或错)。

  • 优点:简单、稳定。
  • 缺点:学生不知道中间哪一步走错了,只知道最后没做对。

于是,研究人员想:“能不能在学生每写一步的时候都给反馈呢?”(这就是“细粒度奖励”)。

  • 理想情况:老师看着学生写第一步,说“好”;写第二步,说“不好,重来”。这样学生进步最快。
  • 现实情况(论文发现的痛点)
    在 AI 的世界里,要判断“第一步”写得好不好,老师必须让学生基于这一步,反复尝试写出后续的所有可能答案(比如尝试 8 次、100 次),看看哪次能算对。
    • 比喻:就像学生刚写下“设 x=...",老师就要让他基于这个开头,在脑子里模拟 100 种不同的解题路径,看看有多少种能算出正确答案。
    • 问题:在资源有限(只能试几次)的情况下,这种模拟充满了噪音。有时候学生第一步其实写对了,但因为运气不好,模拟出来的后续路径都错了,老师就误以为第一步是错的。这种“误判”比直接等最后给分还要糟糕,导致学生越学越糊涂。

2. SKPO 的解决方案:把解题过程切成“两段”

SKPO 的核心思想是:不要试图在每一步都进行昂贵的模拟,而是把解题过程切成“上游”和“下游”两段,用不同的策略对待。

第一阶段:上游(Upstream)—— “先写个开头,别管对错”

  • 做法:模型先写一段解题的开头(比如前 1/6 到 1/2 的内容),然后停下来
  • 奖励机制:这时候,模型不需要基于这个开头去模拟 100 次。它只需要写一次,然后把这个开头交给“下游”去处理。
  • 比喻:就像学生先写个解题思路的大纲。老师不直接给大纲打分,而是说:“先别管对错,你先把这个大纲写出来,我们看看基于这个大纲,能不能解出答案。”
  • 技术细节:这里使用了一种叫“单流优化”的方法,避免了因为样本太少而产生的误判。

第二阶段:下游(Downstream)—— “基于开头,疯狂试错”

  • 做法:模型拿到那个“开头”,然后基于它,同时生成 8 种不同的完整解题过程(就像让 8 个分身同时做题)。
  • 奖励机制
    1. 看结果:这 8 个分身里,有几个做对了?如果大部分做对了,说明刚才那个“开头”是好的。
    2. 跳连(Skip Connection):这是 SKPO 最巧妙的地方。在生成这 8 个完整答案时,模型既看到了“开头”,也保留了“原题”
    • 比喻:这就像老师对学生说:“你可以参考刚才那个大纲(上游),但如果发现大纲走不通,你可以随时扔掉大纲,直接重新看原题,自己重新想。”
    • 作用:这给了模型自由。如果上游的开头是错的,模型不会死脑筋地跟着错下去,它可以“跳过”错误的开头,直接回到原题重新思考。这既利用了上游的提示,又防止了被错误的开头带偏。

3. 为什么这样更好?(核心优势)

  1. 省资源:以前为了判断每一步,需要疯狂模拟;现在只需要在中间切一刀,模拟一次就够了。就像只试一次“开头 + 结尾”的组合,而不是每一步都试。
  2. 更聪明(隐式优势)
    • 论文发现,用 SKPO 训练出来的模型,即使最后答案是对的,它中间思考的步骤质量也更高
    • 比喻:两个学生都解出了答案。
      • 普通方法的学生:可能是蒙对的,中间步骤乱七八糟。
      • SKPO 的学生:中间步骤逻辑清晰,即使最后答案一样,他的解题过程更稳健,更像真正的“推理”。
  3. 通用性强:不仅在数学题上有效,在写代码、通用逻辑推理上也能提升。

4. 总结:一个生动的场景

想象你在教一个机器人下棋:

  • 旧方法(GRPO):机器人每走一步,你都不说话,直到它下完整个棋局,输了就扣分,赢了就加分。机器人不知道哪一步走错了。
  • 笨办法(纯细粒度):机器人每走一步,你都要让它基于这一步,在脑海里模拟下完剩下的 100 种棋局,看看胜率。结果因为模拟次数不够,经常误判,把好棋当坏棋,把坏棋当好棋。
  • SKPO 方法
    1. 机器人先走前 10 步(上游)。
    2. 你让它基于这 10 步,快速模拟 8 种后续下法(下游)。
    3. 如果这 8 种下法里有很多能赢,说明前 10 步走得好,给奖励。
    4. 关键点:在模拟时,你告诉机器人:“你可以参考前 10 步,但如果发现不对劲,随时可以忽略前 10 步,重新看棋盘"。
    5. 这样,机器人既学会了利用好的开局,又学会了在开局不好时及时止损,最终下出了更高质量的棋局。

一句话总结:SKPO 通过巧妙拆分推理过程,用一种“既参考前文,又允许随时重来”的机制,解决了 AI 在精细奖励训练中容易“瞎猜”的问题,让模型在有限的算力下,学会了更高质量的推理逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →