← 最新论文
💬 NLP

ReAD: Reinforcement-Guided Capability Distillation for Large Language Models

ReAD 是一种由强化引导的能力蒸馏框架,它通过动态分配固定的 token 预算来优化下游效用,同时最小化有害溢出和无效努力,从而解决模型能力之间的相互依赖问题。

原作者: Xueqi Cheng, Xugui Zhou, Tyler Derr, Yushun Dong

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xueqi Cheng, Xugui Zhou, Tyler Derr, Yushun Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位博学多才、无所不知的教授(即大型语言模型),他能够解决数学问题、编写代码、推理逻辑谜题,并掌握多种语言。你希望培养一名年轻学生(即小型模型)变得同样聪明,但你只有有限的“学习时间”(固定的令牌预算)。

目标是能力蒸馏:将教授的知识压缩到学生身上,使学生能够出色地完成特定任务,而无需依赖教授那庞大的大脑。

问题:“单科”陷阱

以往的大多数方法都试图一次只教学生一门学科。如果你希望学生擅长数学,你就会让他们只学习数学题,直到耗尽学习时间。

本文作者发现了这种方法的一个隐藏问题:技能是相互关联的。

  • 类比:想象你在训练一名运动员。如果你强迫他们每天只在跑步机上跑步 10 小时以提高跑步速度,他们的跑步速度可能会变快,但他们的游泳、骑行甚至平衡能力可能会变差,因为他们的身体变得过度专业化且失衡。
  • 发现:当学生模型只学习数学时,它不仅没有只在数学上变得更好,反而在推理编程方面意外地变差了。论文将这种现象称为“负面溢出”。
  • 浪费:如果学生在已经掌握基础后,你仍继续给他们更多数学题,他们在数学上的进步会微乎其微(边际收益递减),但他们其他方面的能力却会持续下降。你正在浪费有限的学习时间。

解决方案:ReAD(智能教练)

作者提出了一种名为ReAD(强化引导的能力蒸馏)的新框架。将 ReAD 想象成一位智能、自适应的教练,能够实时管理学生的学习计划。

以下是 ReAD 逐步工作的流程:

1. “职位描述”(任务需求向量)
在学生开始学习之前,ReAD 会审视学生需要完成的具体任务(例如:“回答客户支持问题”)。它会确定哪些技能对该任务真正至关重要。

  • 类比:如果任务是“客户支持”,教练知道你需要语言推理能力,但不需要成为编程大师。ReAD 会生成一份技能的“优先级清单”。

2. “动态课表”(即时数据生成)
ReAD 不会给学生一堆静态的数学书,而是即时生成练习题。

  • 类比:教练会观察学生。如果学生在“推理”方面遇到困难,教练会立即生成更多的推理谜题。如果学生在“数学”方面变得过于出色,以至于开始遗忘“语言”能力,教练就会切换话题到语言,以保持学生的能力平衡。

3. “智能博弈”(不确定性感知老虎机)
这是整个运作的核心。ReAD 使用一种数学工具(上下文老虎机)来决定下一步学习什么。这就像一位知晓赔率的赌徒。

  • 工作原理:教练会问:“如果我把接下来的一个小时花在数学上,学生会变得更好,还是只会感到厌倦并忘记如何写作?”
  • 它在收益(提升目标技能)与溢出(损害其他技能)之间取得平衡。
  • 它还会考虑不确定性。如果教练不确定某种特定的技能变化将如何影响学生,它会尝试一下以获取更多知识,而不是固守僵化的计划。

结果

本文通过用固定的“学习时间”(2000 万或 1.5 亿个令牌)训练学生模型来测试该方法。

  • 旧方法(单科专注):学生在目标技能上表现尚可,但变得失衡,在其他领域退步。
  • ReAD 方法:学生在目标技能上变得更好,同时保持了其他技能的强劲
  • 结果:ReAD 的整体得分高于所有其他方法。它没有在学生已经掌握的技能上浪费时间,并防止了学生在学习新技能时“遗忘”其他重要能力。

总结

ReAD 是一个系统,它不再将学生的技能视为彼此孤立、互不相干的盒子。相反,它认识到学习一件事会改变其他一切。通过利用一位智能、自适应的教练,该教练不断检查学生的进度并调整课程,ReAD 确保每一分钟的学习时间都物有所值,从而创造出更小、更智能的模型,使其无需浪费资源即可适应现实世界的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →