← 最新论文
💻 computer science

DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models

本文提出了蒸馏推理剪枝(DRP),这是一种混合框架,通过结合推理时剪枝、技能感知的步骤分解与蒸馏技术,在保持或提升复杂数学推理任务准确性的同时,显著降低大型推理模型的令牌使用量。

原作者: Yuxuan Jiang, Dawei Li, Francis Ferraro

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Jiang, Dawei Li, Francis Ferraro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《蒸馏推理剪枝(DRP)》的解释。

问题所在:“过度思考”的学生

想象一位非常聪明的学生(学生模型)正在尝试解决一道数学题。这位学生才华横溢,但有一个坏习惯:过度思考

当被问到一个简单的问题,比如“娜塔莉亚 4 月卖了 48 个发夹,5 月卖了 24 个,她总共卖了多少个?”,这位学生不会直接进行计算。相反,他们会写出一篇五页的长文。他们可能会说:

  • “让我想想‘四月’是什么意思……"
  • “等等,我读对数字了吗?让我检查一下笔记……"
  • “实际上,让我再读一遍问题以确保无误……"
  • “好的,现在我要把它们加起来,但首先,让我写下公式……"

这被称为长思维链(Long Chain-of-Thought, CoT)。虽然这表明学生很努力,但这既缓慢,又消耗大量纸张(计算机令牌),而且有时学生会因为陷入自己的喋喋不休而迷失方向,导致犯错或时间耗尽。

旧有的解决方案(为何行不通)

研究人员此前尝试过两种主要方法来解决这个问题:

  1. “停止标志”法(剪枝):告诉学生,“说完五句话就停止。”
    • 问题所在:学生可能会在关键步骤中途停止,导致答案错误。
  2. “模仿者”法(蒸馏):给学生一本由天才教师(教师模型)编写的教科书,书中提供简短完美的答案。
    • 问题所在:学生习惯于用冗长、杂乱的段落进行思考。如果你递给他们一本简短、精炼的教科书,他们无法理解教师是如何得出答案的。这就像试图通过阅读一位从不解释齿轮原理的赛车手所写的驾驶手册来学习开车一样。学生感到困惑,因为“风格”不匹配。

新解决方案:DRP(蒸馏推理剪枝)

作者提出了一种名为DRP的新方法。你可以把它想象成一位个人编辑,坐在杂乱的学生和天才教师之间。

DRP 的工作原理分为三个简单步骤:

第一步:学生写下杂乱的草稿

学生以他们通常的方式解决问题,写出他们冗长、啰嗦的想法(即“长思维链”)。

第二步:“基于技能”的编辑(教师)

一位强大的 AI(教师,如 GPT-4o)充当基于技能的编辑,而不仅仅是重写答案。

  • 分解:编辑将学生的长文分解为带有标签的小步骤。
    • 示例:“步骤 1:读取数字(技能:数据提取)。”
    • 示例:“步骤 2:等等,让我确认一下……(技能:自我修正)。”
  • 剪枝:编辑审视这些步骤并决定如何处理:
    • 保留:“这一步很好。”
    • 删除:“你在这里重复了自己。删掉它。”
    • 重写:“你说了三次。清晰地说一次就好。”
    • 合并:“这两个小想法可以合在一起。把它们合并起来。”

关键在于,编辑保留了学生思考的结构,但去除了“废话”。这就像教练告诉跑步者:“你跑完了整个赛道,但你浪费精力在之字形跑动上。这是你应该走的直线,但请保持你的跑步风格。”

第三步:学生从编辑后的草稿中学习

随后,学生基于这个编辑后、更清晰的版本进行训练(微调)。

  • 因为编辑后的版本仍然看起来像学生自己的思考过程(只是更短、更清晰),学生能学得更快。
  • 他们学会了如何变得高效,而不会丧失解决难题的能力。

结果:更快且更聪明

该论文在数学问题(如 GSM8K 和 AIME 数据集)上测试了这种方法。结果如下:

  • 纸张使用减少:学生开始使用少得多的单词(令牌)。在一次测试中,他们使用的字数从 917 个减少到仅 328 个。这意味着减少了 64%
  • 成绩提升:令人惊讶的是,学生不仅变得更快,而且变得更聪明。他们的准确率从 91.7% 提升到了 94.1%。
  • 原因:通过去除“噪音”和“冗余循环”(即过度思考),学生能更好地专注于实际的数学计算。

核心要点

该论文认为,要教会一个小型、爱唠叨的 AI 变得高效,你不能仅仅强迫它变短。你必须利用一位理解解决问题所需技能的智能编辑,来剪枝它自己的思想

简而言之:DRP 就像把学生杂乱、过度详细的作业交给老师,让老师标出重要部分并划掉无意义的废话,然后让学生学习这个“完美编辑”后的版本。结果就是,学生思维清晰、言简意赅,并且每次都能给出正确答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →