Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning
该论文提出了步级在策略蒸馏(Step-Level On-Policy Distillation, SOPD),这是一种在监督微调与在策略蒸馏之间进行插值的创新方法,旨在对学生生成的轨迹提供完整的步级修正,从而在推理和智能体任务中显著超越这两种传统方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型常被比作必须向老师学习的学生。多年来,教导这些数字学生的标准方式是向它们展示由专家编写的完美范例,并要求它们记忆这一序列。这种被称为“监督微调”的方法虽然有效但过于僵化;它假设学生总能完美地遵循专家的路径,却忽略了学生实际容易犯下的错误。一种被称为“策略内蒸馏”(on-policy distillation)的新方法试图解决这个问题,它让学生生成自己的答案,然后逐个词(token)地对其进行纠正。虽然这让学生能够从自己的错误中学习,但也产生了一个不同的问题:由于纠正过于碎片化,学生永远无法看到一条完整、连贯且通向正确答案的路径。这就像是通过在每次你触碰方向盘时接收一个单词的指令来学习驾驶,而不是被展示如何通过一个完整的弯道。
研究人员现在开发了一种新的训练方法来弥补这一差距,将两者的优点结合在一起。通过引入一种称为“步级策略内蒸馏”(Step-Level On-Policy Distillation)的技术,团队允许学生自主完成一个完整的思想或动作序列,然后要求老师为该旅程中的每个主要步骤提供一次连贯的纠正。这种方法在从解决困难数学题到在虚拟家庭环境中导航等复杂任务上进行了测试。结果表明,这种方法能让学生比以往的技术学得更快、更准确,达到了此前同类规模模型无法企及的成功率。其核心发现是,通过将学习过程分解为自然、有意义的块(chunks),而不是单个词汇或随机的纠正,模型不仅能理解什么是正确答案,还能理解如何从其特定的错误中抵达正确答案。
这种新方法的核心在于它如何处理学生模型与老师之间的交互。在传统的策略内蒸馏方法中,老师观察学生的工作并为生成的每一个单词提供微小的纠正。如果学生在早期犯错,老师会尝试逐词修复,但学生仍处于混乱状态,试图沿着一条破碎的路径前进。新的“步级策略内内蒸馏”改变了这种交互的节奏。首先,允许学生在不受干扰的情况下生成完整的响应或一整套动作序列。一旦学生完成,系统会将该响应分解为自然的步骤,例如数学证明中的一个完整句子,或游戏中一次完整的对话轮次。
此时,老师介入了,但并不是为了重写整个故事。相反,老师观察学生在每个特定步骤的起点,并生成该步骤的一个正确版本。随后,学生学习在保持其原有上下文的同时,匹配这个正确的步骤。这意味着学生学习纠正自己的轨迹,而不至于让老师接管整个过程。老师为旅程的每个部分提供清晰的局部引导,确保学生能从出错的具体位置看到一条完整、逻辑清晰的前进路径。这保留了学生经历错误的过程,同时赋予了它们修复错误的一种结构化方式。
研究人员在两个截然不同的环境中测试了这种方法,以观察其在压力下的表现。第一个测试涉及一个在模拟家中导航的智能体,这项任务被称为 ALFWorld。在这个环境中,模型必须通过与文本世界交互来完成诸如寻找钥匙或清理房间等任务。团队使用了一个强大的老师模型来引导一个较小的学生模型。当他们将新方法与旧的逐词纠正风格进行对比时,结果令人震惊。使用新方法训练的学生在处理已见过的任务时,成功率提升了超过 18 个百分点,在处理从未见过的任务时,提升了超过 21 个百分点。此外,它们完成这些任务所需的尝试次数更少,这表明它们不仅是在更好地猜测,而且是在学习更高效的解题方式。
第二个测试侧重于数学推理,这是一个逻辑一致性至关重要的领域。在这里,模型被要求解决竞赛级别的数学题。研究人员发现,新方法使学生能够将其思考组织成更清晰、更有结构的步骤。随着训练的进行,学生开始生成更明显的推理步骤,而老师的纠正也变得更加丰富和详细。在四个不同的数学基准测试中,使用这种新方法训练的学生以大幅优势超越了之前的最佳方法,平均准确率提升了近 10 个百分点。这证明了该方法不仅适用于简单任务,也是提高复杂推理能力的稳健方式。
这种新技术最实用的优势之一是它不需要老师揭示其内部计算过程。在许多以往的方法中,学生需要获取老师针对每个单词的原始概率得分,如果老师是一个封闭的“黑盒”系统,这通常是无法实现的。新方法仅要求老师生成文本,这使得它更容易应用于那些最佳模型并非完全开放的现实场景。此外,由于老师是基于学生现有的工作一次生成一个步骤,因此该过程更快,并避免了因等待环境对每一个动作做出反应而导致的延迟。
这项研究证实,我们如何构建学习过程与老师的质量同样重要。通过从碎片化的、逐词的纠正转向连贯的、步级的引导,研究人员创造了一种既尊重学生自身路径,又提供清晰纠正地图的训练动态。这种方法成功地将从自身错误中学习的灵活性与专家指导的清晰性结合在一起。研究结果表明,为了让人工智能变得更强大、更可靠,特别是在复杂的交互式任务中,我们必须设计出能够让模型看到其错误的全局图景,并学会如何在一次逻辑性的运动中修复错误的训练方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。