← 最新论文
💬 NLP

PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning

PCL-Reasoner-V1.5 是一个基于 Qwen2.5-32B 构建的 320 亿参数数学推理模型,它利用一种新颖的离线强化学习方法,在 AIME 基准测试中实现了最先进的性能,并且与在线强化学习方法相比具有更优越的训练稳定性和效率。

原作者: Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心概览:正在进行“节食”的天才数学家

想象你有一个非常聪明的学生(AI 模型),他已经很擅长数学了,但想要成为世界级的冠军。鹏城实验室和北京大学的研究人员通过对一个名为 Qwen2.5-32B 的强大学生进行了一场特殊的“训练营”,打造出了 PCL-Reasoner-V1.5

结果如何?这个新模型目前在基于该特定“学生”基础的模型中,解决高难度数学问题的能力是最强的。它在 2024 年的一场数学竞赛中取得了 90.9% 的成绩,并在 2025 年的版本中取得了 85.6% 的成绩。

秘诀所在:两步走训练法

研究人员并没有让模型进行随机的练习。他们使用了一个两步走的流程:

  1. 监督微调 (SFT) —— “教科书阶段”:
    首先,他们利用海量高质量的数学问题及其分步解题过程(称为思维链,Chain-of-Thought)来教授模型。这就像是学生阅读最好的教科书,并记忆如何正确地解决问题。这创造了一个中间模型,名为 PCL-Reasoner-V1

  2. 离线强化学习 (Offline RL) —— “模拟考试阶段”:
    这是该论文最具创新性的地方。通常情况下,AI 模型通过参加测试、立即获得评分,然后在老师看着的情况下再次尝试来进行学习(这被称为 在线强化学习/Online RL)。这就像一个学生参加考试,得到一个分数,然后立即改变大脑以修正错误,且这一切都是实时发生的。这种方式可能会变得混乱且缓慢。

    PCL-Reasoner-V1.5 使用了 离线强化学习 (Offline RL)。以下是类比:

    • 旧方法 (在线 RL): 学生参加一场测试,老师评分,学生改变大脑,然后紧接着参加下一次测试。如果老师累了或者评分系统出故障了,整个过程就会崩溃。
    • 新方法 (离线 RL): 学生一次性完成一大叠模拟试卷,并写下所有的答案。老师在之后对整叠试卷进行评分,并制作成一本单一且完美的“标准答案”书。学生随后仅根据这本静态的书进行学习。他们在学习期间不会参加新的测试;他们只是从这些固定的数据中学习。

为什么“离线”更好?

论文认为这种“标准答案”法(离线 RL)之所以更优越,主要有三个原因:

  • 稳定性(没有过山车): 在线学习就像是在引擎被重建时驾驶汽车,是不稳定的。离线学习则像是坐在安静的图书馆里学习;数据是不变的,因此学习过程平稳且可预测。
  • 效率(流水线作业): 在在线方法中,计算机必须不断地停止、思考、评分并更新。而在离线方法中,计算机可以一次性高效地生成所有答案(就像工厂的流水线一样),然后将训练过程分开进行。这节省了大量的时间和计算资源。
  • 简单性: 它更容易管理。你不需要一个复杂的系统来协调实时的评分与学习。你只需要生成数据,保存数据,稍后再进行训练。

模型究竟学到了什么?

研究人员注意到关于模型如何进步的一些有趣现象。

  • 之前 (PCL-Reasoner-V1): 模型会试图快速解决问题。如果一个问题需要非常长、非常复杂的推理过程(例如 30,000 字的思考过程),模型往往会放弃或出错。
  • 之后 (PCL-Reasoner-V1.5): 模型学会了思考得更久。它开始编写更长、更详细的推理步骤。它明白了对于难题,你不能操之过急;你必须仔细探索每一条路径。

总结

论文声称,你并不需要像其他人那样使用复杂、不稳定的实时“在线”训练方法就能获得卓越的结果。通过使用一种更简单、更稳定的“离线”方法——即生成一个固定的答案数据集,然后对其进行训练——该模型成为了数学冠军。

核心要点: 有时候,最好的学习方式并不是在老师注视下不停地参加测试。而是完成一大批模拟测试,拿到一份完美的标准答案,然后彻底研读这份答案。这种方法让 PCL-Reasoner-V1.5 成为了其同类中的顶尖选手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →