← 最新论文
💬 NLP

Training Large Reasoning Models Efficiently via Progressive Thought Encoding

本文提出了一种名为“渐进式思维编码”的参数高效微调方法,通过中间推理过程的固定大小向量化表示,在显著降低大推理模型强化学习训练内存开销的同时,有效克服了传统滑动窗口缓存导致的性能下降问题,从而在严格内存约束下实现了推理准确率的大幅提升。

原作者: Zeliang Zhang, Xiaodong Liu, Hao Cheng, Hao Sun, Chenliang Xu, Jianfeng Gao

发布于 2026-02-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeliang Zhang, Xiaodong Liu, Hao Cheng, Hao Sun, Chenliang Xu, Jianfeng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文解决了一个让超级聪明的 AI 模型(我们叫它“大推理模型”)变笨、变慢、变贵的核心问题。

想象一下,你正在训练一个天才数学家(AI 模型)去解世界上最难的数学题。

1. 遇到的难题:大脑内存不够用

这个数学家解题时,习惯在草稿纸上一步步推导(这叫“思维链”)。

  • 传统方法(RL 训练):为了让他学会解题,我们需要让他反复尝试,每次尝试都要把整张草稿纸从头到尾读一遍,才能知道最后答案对不对。
  • 问题出在哪?:如果题目太难,草稿纸写得像一本字典那么长,AI 的“工作内存”(GPU 显存)根本装不下。
    • 方案 A(硬撑):强行把整本字典塞进内存。结果:电脑直接死机,或者训练速度慢到像蜗牛爬,成本极高。
    • 方案 B(粗暴丢弃):为了省内存,只保留最近写的几行字,把前面的草稿纸撕掉扔掉。结果:数学家忘了前面的关键步骤,解题逻辑断了,越做越错。

这就陷入了一个死循环:要么内存爆炸,要么变笨。

2. 论文的创新解法:“渐进式思维编码”

这篇论文提出了一种叫**“渐进式思维编码”(Progressive Thought Encoding)**的新方法。

我们可以用一个生动的比喻来理解:

想象这位数学家有一个神奇的“记忆胶囊”和一本“随身笔记”。

  • 以前的做法:草稿纸写满了,就把旧纸撕了扔掉。数学家忘了前面写了什么,只能瞎猜。
  • 论文的做法
    1. 不扔掉,而是“压缩”:当草稿纸(KV Cache)写满时,数学家不会把旧内容直接扔掉。相反,他会把刚才写过的关键思路,提炼成几个**“记忆胶囊”**(固定大小的向量)。
    2. 注入“超能力”:这些“记忆胶囊”会被注入到数学家的大脑核心(模型参数/LoRA 适配器)里。
    3. 继续解题:虽然眼前的草稿纸变短了(只保留最近的),但因为关键信息已经变成了他大脑里的“本能”,他依然能记得前面的逻辑,继续流畅地解题。

简单来说: 以前是“记不住就忘”,现在是“记不住就把它刻在脑子里”。

3. 这个方法好在哪里?

  • 省内存(省钱):因为不需要把整本“字典”都塞进显存,只需要保留一小块“当前草稿”加上几个“记忆胶囊”,所以电脑内存占用直接减半
  • 不降智(变强):因为关键信息没有丢,只是换了一种存储方式,所以 AI 的解题能力不仅没下降,反而因为训练更顺畅(可以跑更长的推理过程)而变强了
  • 速度快:训练和推理都更快了,因为不用处理海量的历史数据。

4. 实验结果:真的有用吗?

作者在几个著名的数学竞赛题目(像 AIME、AMC 这种很难的题)上测试了三种 AI 模型(Qwen 和 DeepSeek 系列):

  • 对比对象
    • 普通 AI:没经过特殊训练。
    • 普通微调 AI:用了传统的省钱方法(直接丢弃旧内容)。
    • 我们的 AI:用了“记忆胶囊”法。
  • 成绩
    • 在同样的内存限制下,用新方法训练的 AI,在最难数学题上的准确率比传统方法提高了近 20% 到 30%
    • 特别是在 AIME2024/2025 这种顶级难题上,准确率提升了23.4%
    • 同时,它让训练所需的内存减少了约 50%

总结

这篇论文就像给 AI 工程师发了一套**“压缩饼干”食谱**。

以前,为了让 AI 记住长故事,必须给它一个巨大的冰箱(大内存)。现在,他们发明了一种方法,把故事里的精华提炼成几块高营养的“压缩饼干”(记忆胶囊),让 AI 吃进肚子里(变成参数)。这样,哪怕冰箱很小,AI 也能记住整个故事,并且跑得更快、更聪明。

这对于未来让 AI 在普通电脑上也能处理复杂的推理任务(比如写代码、做科研、解数学题)具有非常重要的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →