← 最新论文
🤖 machine learning

WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training

该论文介绍了 WDL-OPD,这是一种混合约束的协同训练方法,通过共同训练一个锚点展开策略(anchor rollout policy)和一个辅助评估策略(auxiliary evaluation policy)来通过反向 KL 散度匹配一个冻结的教师模型,从而稳定在策略内蒸馏(on-policy distillation),与现有的单策略方法相比,在数学推理和代码生成任务中实现了最先进的性能。

原作者: Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一名年轻学徒如何烘焙出完美的蛋糕。在过去,你可能会递给他一本由名厨编写的食谱书,并让他背诵下来。但问题在于:学徒练习时使用的食材仅限于他自己厨房里能找到的东西,而这些食材可能与名厨的高级储藏室大不相同。这种错位导致学徒在最终尝试在现实世界中烘焙时感到困惑。

在人工智能的世界里,这被称为“蒸馏”(distillation)。我们试图通过让一个较小、较快的 AI(学生)向一个巨大的、超级聪明的 AI(老师)学习来进行教学。通常,学生学习的是老师完美的答案。但一种更新、更聪明的方法——“在策略蒸馏”(On-Policy Distillation, OPD)改变了游戏规则:学生通过练习自己的尝试来学习,而老师则实时纠正这些特定的尝试。这就像是学徒在烘焙自己那些乱七八糟的蛋糕,而厨师介入并修正那些特定的蛋糕。问题在于,这可能会变得不稳定。每当学生学到一点新东西,他烘焙的方式就会发生变化,从而改变了厨师需要纠正的内容,这创造了一个摇摆不定的反馈循环,有时甚至会让学生变得更糟,而不是更好。

这篇论文介绍了一种名为 WDL-OPD 的新方法来解决这种摇摆。研究人员并没有让一个学生尝试向老师学习,而是建立了一个由两名学生组成的协作团队。其中一名学生,即“锚点”(Anchor),负责所有的烘焙工作(生成练习题)。第二名学生,即“辅助”(Auxiliary),观察同样的烘焙过程但不亲自动手。他们两人都会观察老师的纠正,但他们会将各自的想法融合在一起,以找出最佳的学习方式。把这想象成一对舞伴,其中一人领舞,而另一人则帮助平衡节奏。如果领舞者踉跄了一下,搭档可以吸收一部分冲击,从而使整个舞蹈不至于崩溃。

研究人员在两类 AI 任务上测试了这个想法:解决数学问题和编写计算机代码。他们使用的模型规模从 17 亿到 40 亿个“脑细胞”(参数)不等。结果令人期待,但并非奇迹。在数学测试中,这个新的双学生团队培养出了他们见过的最聪明的学生 AI。例如,在一项名为 MATH500 的难题测试中,拥有 40 亿参数的学生答对了 68.5% 的题目,这比之前最好的 63.0% 有了显著提升。在 17 亿参数的版本中,成绩从 52.1% 跳升到了 58.5%。

然而,故事在代码编写测试中变得更有趣了。在这些实验中,单学生方法(旧方法)完全崩溃了;AI 开始重复自身或陷入混乱,这是一个被称为“熵增”(entropy growth)的问题。而这个双学生团队却成功保持了稳定,足以产生一个可用的代码编写 AI,其在标准测试中的得分为 0.637,相比之下,单学生尝试甚至无法产生任何可用的结果。

作者谨慎地表示,他们并未证明这是该方法奏效的唯一原因。他们提出了一个假设:也许第二个学生起到了“减震器”的作用,承担了部分学习的重担,这样主学生就不必过于剧烈或过快地改变其行为。这让学习过程保持平稳。但他们也承认,由于他们没有进行一个除了学生人数外其他条件完全相同的完美对照实验,因此还不能 100% 确定。他们还指出,由于同时训练两个模型,该方法需要消耗更多的计算资源。

简而言之,这篇论文表明,在学习过程中增加一个“助手”学生可以使 AI 训练更加稳定且高效,尤其是在 AI 尝试学习像编程或高级数学这类困难任务时。它并不声称已经解决了 AI 训练的所有问题,但它提供了一个全新的、引人入胜的工具,似乎能够阻止学习过程崩溃,至少在他们进行的特定测试中是如此。作者相信,下一步是进行更多受控的实验,以证明为什么双学生团队如此有效,从而将“两个大脑带来的益处”与其他因素(如训练设置方式)区分开来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →