← 最新论文
🤖 AI

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

该论文介绍了 ISPO,这是一种新颖的策略优化方法,它通过利用源自策略自身概率的内在信号来使二元奖励稠密化,从而消除零优势崩溃(Zero-Advantage Collapse)和幻觉确定性(Hallucinated Certainty),进而显著提升大型语言模型在挑战性数学基准测试中的长链推理性能。

原作者: Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位才华横溢但固执的学生(即 AI)如何解决复杂的数学问题。这个学生在给出最终答案之前,会写出一段长长的、逐步进行的“思考过程”。

在目前的标准方法(称为 GRPO)中,老师只在最后给出反馈:“正确!”或“错误。”

这篇论文指出,这种“全有或全无”的反馈造成了两个主要问题:

  1. “群体沉默”问题(零优势坍缩):
    假设你要求学生解决 8 个类似的题目。

    • 如果 全部 8 个 都对了,老师会对所有人说:“做得好!”但因为每个人的得分都一样,老师无法分辨哪些具体的思考步骤更好。学生学不到任何新东西,因为没有差异可以进行比较。
    • 如果 全部 8 个 都错了,老师会对所有人说:“再试一次。”同样,没有人知道自己为什么失败,或者哪一个具体的步骤出了问题。学生会陷入盲目猜测的循环。
    • 论文的解决方法: 论文建议不要仅仅看最终的成绩,而是要观察思考过程本身,从而发现细微的差异,即使每个人的最终得分相同。
  2. “自信地错误”问题(幻觉式确定性):
    随着练习的深入,学生可能会开始犯错,但却变得越来越笃定。他们可能会说:“我 100% 确定 2+2=5”,并且表现出完美的自信。

    • 在旧系统中,老师只会在最后看到“错误”。老师看不到学生在整个过程中过早地变得“过于自信”。学生停止了探索其他可能性,只是重复着他们那些自信的错误。
    • 论文的解决方法: 老师需要在特定的关键步骤上,对这种“自信地错误”进行惩罚,鼓励学生在遇到困难时保持开放的心态。

解决方案:ISPO(内在信号策略优化)

作者提出了一种名为 ISPO 的新方法。你可以把它想象成给学生的推理过程一个“动力加速”。老师不再等待最终的考试成绩,而是利用源自学生自身大脑(AI 自身的概率)的两种内部“信号”,提供持续且密集的反馈。

这里有两个用于监测的“仪器”:

1. “思考-答案链接”(序列级信号)

  • 比喻: 想象学生写了一个故事(思考轨迹),然后得出了一个结论(答案)。
  • 运作方式: 老师会检查:“如果我把故事删掉,结论还能成立吗?”
    • 如果故事对答案有极大的影响(高链接),这意味着学生确实通过思考得出了答案。
    • 如果故事对答案完全没有影响,这意味着学生只是先猜出了答案,然后再编造一个故事来匹配它。
  • 益处: 即使整个小组得到了相同的“错误”评分,老师也能看出学生 A 的故事实际上对他的答案很有帮助,而学生 B 的故事则是胡言乱语。这打破了“群体沉默”,让每个人都有学习的动力。

2. “信心检查”(Token 级信号)

  • 比喻: 想象学生正在走钢丝。在某些关键时刻(Token),他们必须做出艰难的选择。
  • 运作方式:
    • 如果答案是正确的: 老师会奖励学生在这些关键步骤上表现出的自信与清晰。
    • 如果答案是错误的: 老师会观察学生的信心。如果学生在错误的情况下表现得非常自信,老师就会踩下刹车(一种“铰链惩罚”)。这迫使学生意识到:“等等,我不应该这么确定我是对的。”
  • 益处: 这解决了“自信地错误”问题。它迫使学生在陷入困境时保持谦逊并探索其他选项,而不是在错误的道路上越走越远。

结果

论文在三个不同的 AI 模型和五个困难的数学基准测试(如 AIME 和奥林匹克竞赛)上测试了这种方法。

  • 结果: 新方法(ISPO)始终优于旧方法。
  • 表现最突出的地方: 它在最难的问题上帮助最大。这很好理解,因为在难题上,旧方法经常陷入“群体沉默”(大家都错了,所以没人能学到东西)。ISPO 通过寻找那些细微的“思考-答案链接”并纠正“自信的错误”,保持了学习的持续进行。

简而言之,这篇论文教 AI 模型去学习其“思考过程的质量”,而不仅仅是看最终的分数。它就像一位教练,不仅会说“你输掉了比赛”,还会说“你在第二节的表现很棒,但在第三节你变得太自信了——让我们改进这一点。”这使得即使在最终结果失败时,也能保持学习的动力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →