← 最新论文
🤖 machine learning

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

本文提出了 Klear-Reasoner 模型,通过深入分析从数据准备到强化学习的完整后训练流程,并创新性地提出梯度保留策略优化(GPPO)以解决传统截断机制抑制探索信号的问题,从而在数学和编程基准测试中实现了卓越的推理性能。

原作者: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇技术报告介绍了一个名为 Klear-Reasoner 的人工智能模型。你可以把它想象成一个**“超级解题天才”**,它特别擅长做数学题和写代码。

为了让你更容易理解,我们把训练这个 AI 的过程想象成培养一个顶尖的“解题教练”。这篇报告主要讲了三个核心故事:

1. 选教材:少而精,而不是多而杂 (SFT 阶段)

在让 AI 学习之前,首先要给它找“教材”(数据)。

  • 传统做法:很多人觉得教材越多越好,不管质量如何,只要种类多就行。这就像给学生发了一堆书,里面有名著,也有乱写的日记,甚至还有错别字连篇的草稿。
  • Klear-Reasoner 的做法:他们发现,“少而精”的教材效果最好
    • 比喻:这就好比教学生下棋,与其给他看一万盘乱七八糟的对局,不如给他看100 盘由世界冠军下的、逻辑完美的棋谱
    • 关于“错题”:他们发现了一个反直觉的秘诀。对于简单的题目,如果教材里有错题,学生会学坏;但对于极难的题目,教材里保留一些“错误示范”反而有好处
    • 为什么? 因为难题本身就很难,学生需要看到“哪里容易走错路”,这样他才能学会如何避开陷阱。就像学游泳,教练不仅教你怎么游,还要告诉你“如果头抬太高会呛水”,这种“错误示范”在高手进阶时反而成了宝贵的经验。

2. 练内功:一种全新的“奖惩机制” (RL 阶段 & GPPO)

学完教材后,AI 需要通过“强化学习”(RL)来实战演练。这里有一个核心问题:当 AI 做错了,或者做得太“大胆”时,该怎么惩罚或奖励它?

  • 旧方法(传统剪辑)

    • 想象 AI 在探索新路线。如果它走了一步很冒险但可能很好的路(高熵 token),旧方法会直接说:“停!这个步子迈太大了,不算!”(直接切断梯度)。
    • 如果 AI 走了一步明显错误的死胡同,旧方法会说:“这个太烂了,别管它,直接跳过。”(切断负样本梯度)。
    • 后果:AI 变得不敢冒险(探索能力差),而且学不会从错误中快速吸取教训(收敛慢)。
  • Klear-Reasoner 的新方法 (GPPO)

    • 他们发明了一种叫 GPPO (梯度保留剪辑) 的机制。
    • 比喻:这就好比一个**“温和的教练”**。
      • 当 AI 走了一步太冒险的路(即使超出了安全范围),教练不会直接把它踢出局,而是说:“这一步虽然有点野,但保留你的思考过程,只是把奖励稍微压低一点点,让你知道要收敛一点,但别完全否定你的探索。”
      • 当 AI 走了一步明显错误的路,教练也不会直接无视,而是说:“虽然这条路不通,但你要记住为什么不通,这个教训我们要记下来,下次别再犯。”
    • 效果:AI 既敢于探索新路径(因为冒险不会被完全抹杀),又能从错误中快速学习(因为错误不会被忽略)。这让它学得更稳、更快。

3. 考试策略:给“部分正确”一点甜头 (奖励设计)

在写代码的测试中,AI 经常写出“大部分都对,但有个小 bug"的代码。

  • 旧方法(硬奖励):要么全对给满分,要么有一个错给零分。这就像考试,错一个字母就判不及格。这会让 AI 觉得“反正我也拿不到分,不如乱猜”,或者因为怕错而不敢尝试。
  • Klear-Reasoner 的方法(软奖励):如果代码通过了 16 个测试用例中的 4 个,就给 0.25 分。
    • 比喻:这就像**“按步给分”。哪怕只做对了一半,也给你一点鼓励。这让 AI 知道:“哦,我离成功很近了一步,再改一点点就能全对。”这种连续的反馈**让 AI 进步得更快、更稳。

总结:Klear-Reasoner 有多强?

通过这套“精选教材 + 温和教练 + 按步给分”的组合拳,Klear-Reasoner 展现出了惊人的实力:

  • 数学竞赛(AIME 2024/2025)中,它的得分高达 90.5%83.2%,超过了之前很多著名的模型。
  • 编程竞赛(LiveCodeBench)中,它也取得了顶尖的成绩。

一句话总结
这篇论文告诉我们,训练 AI 不需要“人海战术”(堆砌海量数据),也不需要“严刑峻法”(一刀切的奖惩)。精选高质量的“错题集”,用一种“既鼓励探索又包容错误”的温和方式去引导,就能培养出真正会思考、能举一反三的超级 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →