← 最新论文
🤖 machine learning

Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing

该论文提出了近策略蒸馏(NPD),这是一种异步框架,通过将生成与训练解耦并采用Δ\Delta-IFD 过滤来缓解策略滞后,从而加速了在线策略知识蒸馏,实现了比标准监督微调(SFT)和更大模型快 8.1 倍的速度提升以及更优越的性能。

原作者: Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《近策略蒸馏》(Near-Policy Distillation)的解释。

核心难题:“教师 - 学生”不匹配

想象一下,你正在教一名学生(一个小 AI 模型)如何写文章,方法是让他们模仿一位大师级教师(一个巨型 AI 模型)。

  • 旧方法(标准蒸馏): 你给学生一份教师已经写好的文章清单。学生死记硬背这些文章。但当学生参加考试时,他们必须从头开始写作。由于他们只记住了教师的完美答案,一旦需要生成自己的句子,就会感到困惑。这就像一个能背诵剧本的学生,在被要求即兴发挥时却僵住了。
  • “同策略”方法(昂贵的修复方案): 为了解决这个问题,你让学生先自己写文章,然后拿给教师批改。这种方法效果很好,因为学生能从自己的错误中学习。然而,它极其缓慢。每写一个句子,教师都必须停下来,阅读、评分并给出反馈,之后学生才能写下一个句子。这就像一位辅导老师,除非给上一个句子评完分,否则绝不允许学生写下一个字。

解决方案:近策略蒸馏(NPD)

作者提出了一种名为近策略蒸馏的新方法。你可以把它想象成一条高速装配线,它保留了“同策略”方法的优点,却去除了其缓慢的缺点。

其工作原理如下,分为三个部分:

1. 异步装配线(解耦)

NPD 不再让教师和学生在缓慢的一对一对话中工作,而是将他们分离开来。

  • 学生的任务: 学生模型在计算机上快速运行,一次性生成数千篇文章(回复),就像工厂批量生产产品一样。它不需要等待教师。
  • 教师的任务: 一旦学生积累了一大堆文章,教师模型就会一次性审视所有这些文章。由于教师无需等待学生打字,它可以“成批”处理(就像一次读完一整章书,而不是一次读一页)。
  • 结果: 这种方法比旧有的缓慢方法快 8.1 倍,因为计算机不再因等待反馈而闲置。

2. “安全过滤器”(∆-IFD 机制)

这里有一个陷阱。由于学生是在教师评分之前生成文章的,学生可能会对自己的想法有些“上头”。它可能会开始胡言乱语或完全错误地写作,因为它的“策略”(思维方式)已经偏离了教师。

为了解决这个问题,论文引入了一种名为**∆-IFD智能过滤器**。

  • 类比: 想象学生是一位新手厨师,而教师是一位米其林星级厨师。学生做了一堆菜。
    • 区域 1(退化区): 学生做的菜太简单、太奇怪(比如一碗白开水),连教师都觉得太容易,但学生却感到困惑。过滤器会将这些丢弃。
    • 区域 2(认知脱节区): 学生对自己做的菜非常自信,但米其林厨师认为这是垃圾。这很危险,因为学生固执地错了。过滤器会将这些丢弃。
    • 区域 3(邻近学习区): 学生做的菜略高于其技能水平,但教师认为这很好且有帮助。这是学生唯一从中学习的区域。

这个过滤器确保学生只从“金发姑娘”式的例子中学习——不太容易,不太难,也不危险地错误。即使学生和教师不是实时交流,这也能保持训练的稳定。

3. “稀疏更新”(偶尔的重置)

通常,在这些高速装配线上,随着时间的推移,学生的想法可能会偏离教师的风格太远。

  • 修复方案: NPD 不会为了每一秒都同步而停止整个工厂(这太慢了),而是偶尔停止流水线,将学生的“大脑”重置以匹配教师当前的风格。
  • 结果: 论文发现,在整个训练过程中只需进行一两次这样的“重置”,就足以让一切保持正轨,从而节省大量时间。

最终成果:超级学生

论文表明,这种方法不仅让学生训练得更快,而且让他们变得更聪明

  • 结果: 他们使用这种方法训练了一个拥有 10 亿参数的小模型(一个“微型”AI)。
  • 对比: 这个微型模型在经过 NPD 训练并辅以少量强化学习后,在困难的推理测试中得分68.73%
  • 令人震惊的是: 它击败了一个更大、更著名的模型(Qwen3-1.7B),该模型拥有 17 亿参数,得分仅为63.69%

总结

近策略蒸馏就像建立了一条高速工厂,学生从中学习教师的反馈而无需排队等待。它利用智能过滤器剔除糟糕的示例,并通过偶尔的重置让学生保持在正确的轨道上。其结果是一个微小的 AI,它学得更快、成本更低,最终比大得多的模型更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →