← 最新论文
💬 NLP

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

本文针对大语言模型强化学习中因令牌级重要性采样比率高方差导致的策略优化不稳定问题,提出了一种在线因果卡尔曼滤波方法(KPO),通过自回归地建模并平滑潜在的重要性采样比率状态,在保留局部结构变化的同时有效抑制噪声,从而在数学推理等任务上实现了比现有最先进方法更稳定且高效的策略优化。

原作者: Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文解决了一个大语言模型(LLM)在“自我提升”过程中遇到的棘手问题。为了让你轻松理解,我们可以把训练大模型想象成教一个学生做数学题,而这篇论文提出的方法(KPO)就像是一位超级聪明的“情绪稳定教练”

1. 背景:学生为什么学崩了?

想象一下,你有一个很聪明的学生(大语言模型),他在做数学题。

  • 旧方法(GRPO): 老师(算法)让学生做很多道题,然后根据对错给反馈。但是,老师有时候会突然改变“评分标准”(策略更新)。
  • 问题所在: 在每一道题的解题过程中,学生可能会突然“走神”或者“过度自信”。
    • 比如,在解题的前半段,学生很稳;但在后半段,他可能突然开始胡编乱造,或者突然变得极其保守。
    • 在数学上,这表现为**“重要性采样比率”(IS Ratio)像过山车一样剧烈波动**。今天觉得这个步骤“太棒了”(比率极高),下一秒觉得“太烂了”(比率极低)。
  • 后果: 这种剧烈的、毫无规律的波动,让老师(优化算法)晕头转向。老师不知道该听哪一句,导致学生要么学得太激进(乱改),要么学得太保守(不敢动),最后训练崩溃,成绩不升反降。

2. 现有方法的笨办法

为了解决这个问题,以前的老师(其他算法)通常用两种笨办法:

  1. 一刀切(Sequence-level IS): 不管学生解题过程中哪一步出了问题,老师直接给整道题打一个平均分
    • 比喻: 学生前半段做得完美,后半段胡编乱造,老师直接说:“这道题整体表现一般,扣 5 分。”
    • 缺点: 这样太粗糙了!学生前半段的努力被埋没了,后半段的错误也没被精准纠正。
  2. 单独调整但不管逻辑: 试图单独调整每一步,但忽略了步骤之间的连贯性
    • 比喻: 老师盯着每一个字看,发现这个字写得不好就改,那个字写得不好也改,完全不管上下文。结果学生改得面目全非,逻辑全断了。

3. 这篇论文的妙招:KPO(卡尔曼滤波教练)

这篇论文提出了一个叫 KPO 的新方法。它的核心思想是:“相信趋势,忽略噪音”

作者发现,虽然学生的状态(离题程度)在微观上看起来乱跳,但在局部(比如连续的几个解题步骤)应该是有逻辑、有连贯性的。

核心比喻:卡尔曼滤波 = 智能降噪耳机

想象学生解题时的状态是一个正在播放的音频信号

  • 真实的信号: 学生真实的解题思路(比如:先列方程,再代入,最后计算)。这应该是平滑、连贯的。
  • 噪音: 计算时的笔误、瞬间的走神、或者模型输出的随机抖动。这些让信号看起来像“滋滋”作响的杂音。

KPO 就像一副“智能降噪耳机”:

  1. 预测(Prediction): 耳机先根据学生过去的表现,预测他现在应该是什么状态。(比如:既然前一步是列方程,下一步大概率是代入,而不是突然开始写诗歌)。
  2. 观察(Observation): 耳机听到学生当前实际输出的状态。
  3. 融合(Update): 耳机比较“预测”和“实际”。
    • 如果实际输出只是偶尔的“滋滋”声(噪音),耳机就忽略它,坚持认为学生还在列方程。
    • 如果实际输出真的变了(比如学生真的开始写诗歌了),耳机就会平滑地调整预测,而不是瞬间跳变。

这样做的好处:

  • 去噪: 把那些瞬间的、剧烈的、不合理的波动(比如突然的极高或极低的评分)给“熨平”了。
  • 保真: 保留了学生解题思路中真实的、连贯的变化。如果学生真的从“列方程”转到了“计算”,KPO 会平滑地捕捉到这个转变,而不是像以前那样忽高忽低。

4. 实验结果:效果如何?

作者用这个“智能教练”去教学生做高难度的数学竞赛题(比如 AIME、Olympiad 等)。

  • 结果: 使用 KPO 的学生,不仅成绩更好(在多个数学基准测试中超越了最先进的方法),而且学习过程更稳定
  • 对比:
    • 旧方法(GRPO):学生学一会儿就“崩溃”了,成绩忽上忽下,最后甚至退步。
    • 旧方法(GSPO/GMPO):学生很稳,但学得太慢,成绩到了瓶颈就上不去了。
    • KPO: 学生既稳又快,能处理最难的题目。

5. 总结

简单来说,这篇论文发现大模型在自我进化时,因为“情绪”(策略权重)波动太大而容易学崩。

他们发明了一种**“平滑滤镜”(KPO),就像给模型戴上了降噪耳机。这个滤镜能过滤掉那些毫无意义的瞬间波动**,同时保留解题思路中真实的逻辑连贯性

一句话概括:
以前教模型是“听风就是雨”,现在用 KPO 教模型是“透过现象看本质”,让模型在保持逻辑连贯的同时,更稳定、更高效地学会解决难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →