Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction
本文提出了一种推理感知压缩(RAC)剪枝技术,该技术联合重构输入激活值与策略内思维链轨迹,在有效降低推理模型部署成本的同时,避免了标准剪枝方法所导致的性能下降和延迟增加。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢、成绩斐然的学生,名叫“推理 AI"。这位学生擅长解决复杂的数学问题和编写代码,但他们有一个古怪的习惯:在给出最终答案之前,他们会写下一份庞大而详尽的思维过程日记。他们不会只说“答案是 42",而是会写下 50 页的“让我看看,如果我尝试这个,然后是那个,但等等,也许不行……",最后才得出答案。
虽然这使他们非常准确,但运行起来也极其缓慢且昂贵。你想要雇佣一个更小、更便宜的该学生版本(即“剪枝”模型)来完成同样的工作。
问题:“错误作业”的谬误
通常,当工程师试图缩小这些大型 AI 模型时,他们会使用一种称为剪枝的方法。可以将剪枝想象成编辑一本书以使其变短,通过删除你认为不重要的词语。
为了决定删除哪些词语,编辑者(即剪枝算法)通常会查看该学生输入的样本——即他们被问到的问题。他们会假设:“好吧,这位学生擅长回答这些问题,所以如果我们保留他们处理这些问题的‘大脑’部分,就没问题。”
这篇论文认为,这对于推理模型来说是一个巨大的错误。这就像试图通过只观察马拉松选手系鞋带的过程来训练他们一样。你忽略了他们真正奔跑的部分。
对于推理模型而言,“奔跑”的部分就是漫长的思维链(CoT)。如果你只基于问题(输入)来训练剪枝算法,而忽略了漫长的思维过程,那么缩小后的模型就会陷入混乱。它开始比以往更加喋喋不休,写出 100 页混乱的思绪而不是 50 页,并且仍然会答错答案。它变得既更慢又更笨。
解决方案:“推理感知压缩”(RAC)
作者提出了一种简单的修正方法,称为推理感知压缩(RAC)。
他们建议,不要仅仅向剪枝算法展示问题,而是说:“让我们让模型先回答问题,写出完整的思维过程,然后利用整个过程来决定删除什么。”
类比:排练
想象你正在编辑一部戏剧。
- 旧方法:你阅读剧本的开场白,并根据演员在第一场戏中的表现来决定解雇哪些演员。
- RAC 方法:你观看整个排练过程,包括那些漫长、混乱的中间场景,演员们正在那里梳理剧情。你只解雇那些在正式演出中搞砸的演员。
通过让模型在编辑阶段“排练”自己的思维过程,剪枝算法能够确切地学习到哪些“大脑”部分对于漫长而复杂的推理步骤是必需的。
尝试后的结果
该团队在几个强大的 AI 模型(如 DeepSeek-R1 和 Qwen)上,使用数学和编程测试对此进行了测试。
- 准确性:当他们使用旧方法时,剪除模型 50% 的“大脑”会导致其几乎在所有任务上失败。而使用 RAC 后,即使移除了 50% 的权重,缩小后的模型仍保留了几乎所有的智能。
- 速度:旧方法使模型变得如此困惑,以至于它们会喋喋不休数小时,回答问题耗时极长。RAC 保持了模型的专注。它们回答的速度与大模型一样快,甚至更快,因为它们不会陷入混乱思维的循环中。
- 通用性:无论他们是随机剪除模型还是按特定模式剪除,也无论应用于何种类型的模型,这一技巧都有效。
结论
如果你想让一个聪明、具备推理能力的 AI 变得更小、更便宜,你不能只看它被问到的问题。你必须观察它在回答问题时是如何思考的。通过将模型自己的“思维日记”纳入编辑过程,你可以在不损失其智能或降低速度的情况下缩小模型。这是一个简单的调整,能防止模型在自己的思绪中迷失方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。